Questão nº 48

Questão de Ciência de Dados · FGV CGU 2021 - Tarde (nº 48)

FGV2021Auditor Federal de Finanças e Controle - Área Tecnologia da InformaçãoCiência de Dados
Gabarito: Cver comentário ↓

Durante a elaboração de um sistema de busca de informações biomédicas, foi construído um modelo de linguagem vetorial não contextual para estimar relações de similaridade semântica necessárias para comparação entre queries e documentos. Entretanto, verificou-se nos testes iniciais que o desempenho do modelo ficou insatisfatório, devido a muitos termos técnicos presentes nos documentos testados, que não haviam sido incorporados ao modelo.

Para aliviar esse problema, uma tarefa de processamento do texto e seu estágio correspondente no processamento de linguagem natural que poderiam ser aplicados na construção do modelo são, respectivamente:

Resposta comentada

Gabarito Alternativa C

O conceito-chave aqui é que análise léxica é a etapa que identifica e processa as unidades mínimas de significado (morfemas) dentro das palavras, e a decomposição morfológica (ou stemming) é a técnica que quebra essas palavras em seus radicais. Isso permite que o modelo reconheça termos técnicos biomédicos mesmo que eles não apareçam exatamente na mesma forma no vocabulário treinado, agrupando variações (ex: "cardíaco" e "cardiopatia" → "cardi") e reduzindo a dispersão de dados.

  • (A) Incorreta: Word embedding é uma técnica de representação vetorial (o produto final), não uma tarefa de processamento de texto; e análise léxica é o estágio, mas a tarefa citada não é a correta para resolver o problema de vocabulário desconhecido.
  • (B) Incorreta: Lematização é uma técnica válida, mas ela depende de um dicionário morfológico completo (que falharia com termos biomédicos raros), e análise sintática (estudo da estrutura das frases) não resolve o problema de palavras desconhecidas.
  • (C) Correta: A decomposição morfológica (quebrar "neuroinflamação" em "neuro" + "inflamação") é a tarefa de processamento que reduz termos técnicos a seus radicais, e a análise léxica é o estágio do PLN que lida com a estrutura interna das palavras, permitindo que o modelo generalize melhor para termos não vistos.
  • (D) Incorreta: Word embedding é a representação final (não uma tarefa de processamento), e análise semântica (significado de frases inteiras) é um estágio posterior e mais complexo, não o primeiro passo para lidar com vocabulário desconhecido.
  • (E) Incorreta: A decomposição morfológica está correta, mas a análise sintática (estudo da ordem e relação entre palavras na frase) não ajuda a reconhecer termos isolados desconhecidos; o estágio correto seria a análise léxica, não a sintática.

Armadilha da banca na alternativa (A): A pegadinha mais tentadora é a letra A, porque word embedding é um termo famoso e parece "técnico". Mas a banca troca a tarefa (decomposição morfológica) pela representação (word embedding). O modelo já é um word embedding; o problema é que ele não conhece as palavras. A tarefa de processamento que resolve isso é quebrar as palavras em partes menores (morfemas), o que é feito na análise léxica, não na semântica.

Fonte: FGV CGU 2021 - Tarde Auditor Federal de Finanças e Controle - Área Tecnologia da Informação (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho