Questão nº 77
Questão de Tecnologia da Informação · FGV TCE-ES 2022 (nº 77)
Ao ser contratado por uma empresa da área de e-commerce, o cientista de dados Pedro foi alocado a um importante projeto: desenvolver um classificador para análise de sentimentos considerando as opiniões emitidas no Twitter pelos clientes dessa empresa. Para o início do trabalho, Pedro recebeu um pequeno conjunto de dados de tweets parcialmente anotados, que foram coletados da rede social por intermédio de uma API, usando como palavras-chave na busca os nomes de diversas empresas de e-commerce.
Como parte das escolhas de técnicas a serem utilizadas no projeto, Pedro optou pelo uso de word embeddings, com o objetivo de resolver o problema muito comum em processamento de linguagem natural de:
- Afalta de anotação nos tweets, pois essa técnica gera automaticamente a anotação a partir das palavras que compõem o texto;
- Bbaixa quantidade de instâncias no conjunto de dados, pois essa técnica produz sobreamostragem da classe minoritária do conjunto de dados, incrementando-o;
- Cmaldição da dimensionalidade, pois essa técnica permite a representação das palavras como vetores de baixa dimensionalidade; (alternativa correta)
- Dpresença de outliers, pois essa técnica elimina as instâncias que não apresentam similaridade ao conjunto de dados como um todo;
- Eflexão de palavras, pois essa técnica reduz substantivos flexionados em gênero ou número e verbos conjugados às suas formas mais básicas.
Resposta comentada
Gabarito Alternativa C
Word embeddings são como um dicionário inteligente para computadores, onde cada palavra é traduzida em uma lista de números (um vetor) que captura seu significado e relação com outras palavras, permitindo que máquinas entendam a linguagem humana de forma mais eficiente.
- (A) Incorreta: Word embeddings represent palavras numericamente, mas não geram anotações (rótulos de sentimento) para os tweets. A anotação é um processo separado, geralmente manual ou semi-automático.
- (B) Incorreta: Essa técnica não realiza sobreamostragem de classes minoritárias. Ela foca na representação das palavras, não no balanceamento do conjunto de dados.
- (C) Correta: A maldição da dimensionalidade ocorre quando o número de características (dimensões) é muito alto, tornando os dados esparsos e dificultando o aprendizado dos modelos. Word embeddings representam palavras como vetores densos em um espaço de baixa dimensionalidade (ex: 100-300 dimensões, em vez de milhares com one-hot encoding), resolvendo esse problema e capturando relações semânticas.
- (D) Incorreta: Word embeddings são uma técnica de representação de texto, não um método para identificar ou remover outliers do conjunto de dados.
- (E) Incorreta: A redução de palavras flexionadas às suas formas básicas é feita por técnicas como lematização ou stemming. Embora word embeddings possam capturar a similaridade entre essas formas, seu objetivo principal não é realizar essa normalização morfológica.
Fonte: FGV TCE-ES 2022 Auditor de Controle Externo - Tecnologia da Informação (Caderno Tipo 1). Reproduzida para fins de estudo.