Questão nº 69
Questão de Análise de Dados · FGV TCU 2021 (nº 69)
FGV2021Auditor Federal de Controle Externo - Área Controle Externo (AUFC-CE)Análise de Dados
Gabarito: Ever comentário ↓
Um analista do TCU gostaria de aplicar um modelo de Latent Dirichlet Allocation (LDA) em um conjunto de textos.
A alternativa que melhor descreve o resultado do modelo é:
- Auma lista de tópicos, cada um com um título diferente
- Buma lista das palavras mais importantes no conjunto de documentos
- Ccada documento é classificado em somente um tópico, onde cada tópico é formado por uma lista de palavras
- Dcada documento possui uma distribuição de probabilidade de pertencer a algum dos tópicos, onde cada tópico é formado por uma lista de palavras e cada palavra pertence a somente um tópico
- Ecada documento possui uma distribuição de probabilidade de pertencer a algum dos tópicos, onde cada tópico é formado por uma distribuição de probabilidade sobre todas as palavras presentes nos documentos (alternativa correta)
Resposta comentada
Gabarito Alternativa E
O modelo Latent Dirichlet Allocation (LDA) é uma técnica de modelagem de tópicos que assume que cada documento é uma mistura de tópicos e que cada tópico é uma mistura de palavras. Ele descobre essas misturas probabilisticamente.
- A) Incorreta: O LDA não gera títulos para os tópicos automaticamente; ele fornece distribuições de palavras para cada tópico, a partir das quais um humano pode inferir um título.
- B) Incorreta: Esta alternativa descreve a extração de palavras-chave ou termos importantes, não o resultado completo de um modelo de tópicos como o LDA, que foca na estrutura temática dos documentos.
- C) Incorreta: Esta alternativa está errada em dois pontos: documentos não são classificados em somente um tópico (são misturas de tópicos), e tópicos não são apenas "listas de palavras" (são distribuições probabilísticas sobre palavras).
- (D) Incorreta (Armadilha): Esta é uma armadilha porque acerta que "cada documento possui uma distribuição de probabilidade de pertencer a algum dos tópicos", o que é correto. No entanto, erra ao dizer que "cada tópico é formado por uma lista de palavras" (deveria ser uma distribuição de probabilidade sobre palavras) e, crucialmente, ao afirmar que "cada palavra pertence a somente um tópico". No LDA, uma palavra pode pertencer a múltiplos tópicos, mas com diferentes probabilidades em cada um.
- (E) Correta: Esta alternativa descreve perfeitamente o resultado do LDA. Cada documento é visto como uma combinação probabilística dos tópicos (ex: 70% tópico A, 30% tópico B), e cada tópico é caracterizado por uma distribuição de probabilidade sobre todas as palavras do vocabulário (ex: tópico A tem alta probabilidade para "auditoria", "fiscalização", "contas").
Fonte: FGV TCU 2021 Auditor Federal de Controle Externo - Área Controle Externo (AUFC-CE) (Caderno Tipo 1). Reproduzida para fins de estudo.