Questão nº 71

Questão de Estatística · FGV MP-SC 2022 (nº 71)

FGV2022Analista de Dados e PesquisasEstatística
Gabarito: Dver comentário ↓

Um problema comum no processamento de texto é o tratamento de termos compostos por mais de um token, tais como “Ministério Público”, tal que represente uma unidade linguística distinta, em particular na construção de modelos de linguagem.
Considerando o problema acima descrito, a alternativa que apresenta uma técnica usada para sua resolução é:

Resposta comentada

Gabarito Alternativa D

N-gramas são sequências contíguas de nn itens (letras, palavras, etc.) extraídas de um texto. Para tratar termos compostos como “Ministério Público” como uma unidade, usamos n-gramas de palavras (bigrama, trigrama), que capturam a coocorrência e a ordem dos tokens, permitindo que o modelo trate a sequência inteira como um bloco relevante.

  • (A) Incorreta: “Representação por entidade” refere-se a reconhecimento de entidades nomeadas (NER), que classifica nomes de pessoas, lugares, etc., mas não é uma técnica de representação textual para modelos de linguagem, e sim uma etapa de extração de informação.
  • (B) Incorreta: “Índice invertido” é uma estrutura de dados usada em busca e recuperação de informação (mapeia termos para documentos), não serve para representar termos compostos como unidades linguísticas em modelos de linguagem.
  • (C) Incorreta: “Embedding” (como Word2Vec) gera vetores densos para palavras individuais, mas não resolve diretamente a questão de termos multi-token; exigiria técnicas adicionais (ex.: composição de vetores ou treino específico para frases).
  • (D) Correta: A representação por n-gramas (especificamente bigramas/trigramas de palavras) agrupa tokens consecutivos, capturando a sequência “Ministério Público” como uma unidade, exatamente o que o problema descreve. É a técnica clássica para modelar termos compostos em modelos de linguagem.
  • (E) Incorreta: “Decomposição morfológica” quebra palavras em morfemas (radical, prefixo, sufixo), útil para línguas aglutinantes, mas não lida com sequências de palavras — o problema é sobre múltiplos tokens, não sobre estrutura interna de uma palavra.

Armadilha da banca (no distrator mais tentador, C): Muitos alunos escolhem “embedding” por associar a “representação” moderna de texto. Porém, embeddings padrão são por token (palavra), e não resolvem o problema de unir “Ministério” + “Público” sem treino específico. A banca testa se você conhece a técnica clássica e direta para multi-palavras: n-gramas.

Fonte: FGV MP-SC 2022 Analista de Dados e Pesquisas (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho