Questão nº 71
Questão de Estatística · FGV MP-SC 2022 (nº 71)
Um problema comum no processamento de texto é o tratamento de termos compostos por mais de um token, tais como “Ministério Público”, tal que represente uma unidade linguística distinta, em particular na construção de modelos de linguagem.
Considerando o problema acima descrito, a alternativa que apresenta uma técnica usada para sua resolução é:
- Arepresentação por entidade;
- Bíndice invertido;
- Cembedding;
- Drepresentação por n-gramas; (alternativa correta)
- Edecomposição morfológica.
Resposta comentada
Gabarito Alternativa D
N-gramas são sequências contíguas de itens (letras, palavras, etc.) extraídas de um texto. Para tratar termos compostos como “Ministério Público” como uma unidade, usamos n-gramas de palavras (bigrama, trigrama), que capturam a coocorrência e a ordem dos tokens, permitindo que o modelo trate a sequência inteira como um bloco relevante.
- (A) Incorreta: “Representação por entidade” refere-se a reconhecimento de entidades nomeadas (NER), que classifica nomes de pessoas, lugares, etc., mas não é uma técnica de representação textual para modelos de linguagem, e sim uma etapa de extração de informação.
- (B) Incorreta: “Índice invertido” é uma estrutura de dados usada em busca e recuperação de informação (mapeia termos para documentos), não serve para representar termos compostos como unidades linguísticas em modelos de linguagem.
- (C) Incorreta: “Embedding” (como Word2Vec) gera vetores densos para palavras individuais, mas não resolve diretamente a questão de termos multi-token; exigiria técnicas adicionais (ex.: composição de vetores ou treino específico para frases).
- (D) Correta: A representação por n-gramas (especificamente bigramas/trigramas de palavras) agrupa tokens consecutivos, capturando a sequência “Ministério Público” como uma unidade, exatamente o que o problema descreve. É a técnica clássica para modelar termos compostos em modelos de linguagem.
- (E) Incorreta: “Decomposição morfológica” quebra palavras em morfemas (radical, prefixo, sufixo), útil para línguas aglutinantes, mas não lida com sequências de palavras — o problema é sobre múltiplos tokens, não sobre estrutura interna de uma palavra.
Armadilha da banca (no distrator mais tentador, C): Muitos alunos escolhem “embedding” por associar a “representação” moderna de texto. Porém, embeddings padrão são por token (palavra), e não resolvem o problema de unir “Ministério” + “Público” sem treino específico. A banca testa se você conhece a técnica clássica e direta para multi-palavras: n-gramas.
Fonte: FGV MP-SC 2022 Analista de Dados e Pesquisas (Caderno Tipo 1). Reproduzida para fins de estudo.