Questão nº 67
Questão de Tecnologia da Informação · FGV TCE-PA 2024 (nº 67)
Em processamento de linguagem natural (Natural Language Processing - NLP), é fundamental que sejam utilizadas técnicas para representar palavras numericamente como vetores.
As representações numéricas são importantes para capturar relações semânticas entre as palavras, permitindo, por exemplo, processamentos para a detecção de similaridades entre palavras e o desenvolvimento de chatbots.
Entre as técnicas de NLP para a representação numérica de palavras destacam-se as seguintes:
- Aword2vec e GloVe. (alternativa correta)
- Bstemming e lemmatization.
- Csegmentation e efficient embedding.
- Dseq2seq e symbolic representation.
- Etext-to-speech (TTS) e part-of-speech (POS).
Resposta comentada
Gabarito Alternativa A
Em Processamento de Linguagem Natural (NLP), para que computadores possam "entender" e processar palavras, elas são transformadas em números, especificamente em vetores numéricos (também chamados de embeddings), que capturam o significado e as relações semânticas entre elas.
(A) Correta: word2vec e GloVe são as técnicas mais proeminentes e amplamente utilizadas para criar representações numéricas de palavras na forma de vetores (word embeddings), capturando suas relações semânticas.
(B) Incorreta: stemming e lemmatization são técnicas de normalização de texto que reduzem palavras às suas formas base (raiz ou lema), mas não as representam numericamente como vetores para capturar relações semânticas. Esta é a armadilha da banca: são técnicas de NLP, mas não para o propósito específico da questão.
(C) Incorreta: segmentation refere-se à quebra de texto em unidades menores (como frases ou palavras), e "efficient embedding" é uma característica desejável de um embedding, não uma técnica específica de representação numérica.
(D) Incorreta: seq2seq é uma arquitetura de modelo neural para tarefas de sequência para sequência (como tradução), não uma técnica de representação numérica de palavras. Symbolic representation é um paradigma mais antigo que usa símbolos discretos, contrastando com as representações vetoriais distribuídas.
(E) Incorreta: text-to-speech (TTS) é a tecnologia que converte texto em fala. Part-of-speech (POS) tagging é o processo de identificar a classe gramatical de cada palavra (substantivo, verbo, etc.). Nenhuma delas é uma técnica para representar palavras numericamente como vetores.
Fonte: FGV TCE-PA 2024 Auditor de Controle Externo - Informática - Analista de Sistemas (Caderno Tipo 1). Reproduzida para fins de estudo.