Questão nº 70

Questão de Estatística · FGV MP-SC 2022 (nº 70)

FGV2022Analista de Dados e PesquisasEstatística
Gabarito: Aver comentário ↓

O método Latent Dirichlet Allocation (LDA) é popularmente utilizado para a construção de modelos de tópicos devido a sua flexibilidade e robustez, particularmente em grandes quantidades de texto. Ao mencionar a escolha do LDA em um projeto, um analista foi questionado sobre que aspectos caracterizam a flexibilidade do modelo, especialmente em comparação a um modelo pLSA.
O analista respondeu corretamente:

Resposta comentada

Gabarito Alternativa A

O LDA é um modelo generativo que aprende uma distribuição de tópicos θ\theta para cada documento e, por ser um modelo Bayesiano, ele trata θ\theta como uma variável aleatória com uma distribuição a priori (Dirichlet). É exatamente essa estrutura probabilística que permite inferir os tópicos de um documento que não estava no conjunto de treino, sem precisar re-treinar o modelo — isso é a flexibilidade chave. O pLSA, por outro lado, estima θ\theta como um parâmetro fixo por documento, então não consegue generalizar para dados novos.

  • (A) Correta: O LDA usa inferência Bayesiana (com prior Dirichlet), o que permite calcular a distribuição de tópicos para um documento inédito aplicando a regra de Bayes, sem re-ajustar o modelo — o pLSA não faz isso, pois trata os tópicos de cada documento como parâmetros pontuais fixos.
  • (B) Incorreta: O LDA tem mais variáveis latentes (hiperparâmetros α\alpha e β\beta) que o pLSA, e o overfitting é controlado pela regularização Bayesiana, não pela quantidade de variáveis.
  • (C) Incorreta: Tanto o LDA quanto o pLSA exigem que o usuário especifique o número de tópicos KK a priori; nenhum dos dois descobre isso sozinho.
  • (D) Incorreta: O LDA tem variáveis a priori (os hiperparâmetros da Dirichlet, α\alpha e β\beta) que precisam ser ajustados ou estimados; a ausência de prior é uma característica do pLSA, não do LDA.
  • (E) Incorreta: O LDA, como qualquer modelo de tópicos, depende de pré-processamento (remoção de stopwords, stemming, etc.) para funcionar bem; a flexibilidade não está em ignorar essa etapa.

Armadilha do distrator mais tentador (B): A banca tenta fazer você pensar que "menos variáveis = menos overfitting", mas o LDA é justamente o modelo com mais parâmetros (hiperparâmetros e distribuições completas). A vantagem do LDA sobre o pLSA não é a quantidade de variáveis, e sim a regularização Bayesiana (o prior Dirichlet) que evita overfitting — mas a alternativa B erra ao afirmar que há menos variáveis latentes.

Fonte: FGV MP-SC 2022 Analista de Dados e Pesquisas (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho