Questão nº 70
Questão de Estatística · FGV MP-SC 2022 (nº 70)
O método Latent Dirichlet Allocation (LDA) é popularmente utilizado para a construção de modelos de tópicos devido a sua flexibilidade e robustez, particularmente em grandes quantidades de texto. Ao mencionar a escolha do LDA em um projeto, um analista foi questionado sobre que aspectos caracterizam a flexibilidade do modelo, especialmente em comparação a um modelo pLSA.
O analista respondeu corretamente:
- Aa capacidade de obter uma distribuição de tópicos para documentos inéditos; (alternativa correta)
- Ba presença de menos variáveis latentes a ajustar, causando menos overfitting;
- Ca não necessidade de especificar o número de tópicos a serem encontrados;
- Da ausência de variáveis a priori a serem ajustadas;
- Ea capacidade de modelar texto que não passou por uma etapa de pré-processamento.
Resposta comentada
Gabarito Alternativa A
O LDA é um modelo generativo que aprende uma distribuição de tópicos para cada documento e, por ser um modelo Bayesiano, ele trata como uma variável aleatória com uma distribuição a priori (Dirichlet). É exatamente essa estrutura probabilística que permite inferir os tópicos de um documento que não estava no conjunto de treino, sem precisar re-treinar o modelo — isso é a flexibilidade chave. O pLSA, por outro lado, estima como um parâmetro fixo por documento, então não consegue generalizar para dados novos.
- (A) Correta: O LDA usa inferência Bayesiana (com prior Dirichlet), o que permite calcular a distribuição de tópicos para um documento inédito aplicando a regra de Bayes, sem re-ajustar o modelo — o pLSA não faz isso, pois trata os tópicos de cada documento como parâmetros pontuais fixos.
- (B) Incorreta: O LDA tem mais variáveis latentes (hiperparâmetros e ) que o pLSA, e o overfitting é controlado pela regularização Bayesiana, não pela quantidade de variáveis.
- (C) Incorreta: Tanto o LDA quanto o pLSA exigem que o usuário especifique o número de tópicos a priori; nenhum dos dois descobre isso sozinho.
- (D) Incorreta: O LDA tem variáveis a priori (os hiperparâmetros da Dirichlet, e ) que precisam ser ajustados ou estimados; a ausência de prior é uma característica do pLSA, não do LDA.
- (E) Incorreta: O LDA, como qualquer modelo de tópicos, depende de pré-processamento (remoção de stopwords, stemming, etc.) para funcionar bem; a flexibilidade não está em ignorar essa etapa.
Armadilha do distrator mais tentador (B): A banca tenta fazer você pensar que "menos variáveis = menos overfitting", mas o LDA é justamente o modelo com mais parâmetros (hiperparâmetros e distribuições completas). A vantagem do LDA sobre o pLSA não é a quantidade de variáveis, e sim a regularização Bayesiana (o prior Dirichlet) que evita overfitting — mas a alternativa B erra ao afirmar que há menos variáveis latentes.
Fonte: FGV MP-SC 2022 Analista de Dados e Pesquisas (Caderno Tipo 1). Reproduzida para fins de estudo.