Questão nº 53
Questão de Análise de Informação · FGV CGE-SC 2022 (nº 53)
No processamento de linguagem natural, é preciso realizar transformações de textos em números, geralmente vetores ou matrizes, de forma que sirvam de entrada para os algoritmos computacionais de aprendizado de máquina.
Sobre esses algoritmos de extração de características de textos, assinale a afirmativa incorreta.
- AOs algoritmos de extração de características Bag of Words (BoW) e TF-IDF são diferentes entre si, porque o primeiro conta a quantidade de vezes que uma palavra aparece num texto e o segundo normaliza essa informação utilizando a quantidade de vezes que a palavra aparece no corpus de texto.
- BO algoritmo de word embeddings Word2Vec depende do princípio da distribuição, em que as palavras que geralmente têm as mesmas palavras vizinhas tendem a ser semanticamente semelhantes e as colocam num vetor de tamanhos fixos que representam semanticamente as palavras vizinhas.
- CO algoritmo de word embeddings Glove combina estatísticas locais com estatísticas globais fazendo a análise de uma matriz de co-ocorrência palavra-palavra, de forma que se conta a frequência que essa palavra aparece relacionada com algum "contexto" em um grande corpus.
- DO algoritmo de word embeddings Word2Vec possui duas arquiteturas de construção. A primeira é a CBOW, em que se treina uma rede neural com a tarefa de prever uma palavra dado o contexto e a outra é a Skip-Gram, em que a tarefa da rede neural será dada uma palavra, prever o contexto. (alternativa correta)
- ENa matriz de co-ocorrência do algoritmo de word embeddings Glove, ao correlacionar uma palavra p1 com um contexto c1, se a palavra p1 possui correlação alta com c1, o valor será mais alto do que o contrário; essa correlação poderá ser utilizada para calcular correlações entre quaisquer palavras do corpus de texto e esse contexto.
Resposta comentada
Gabarito Alternativa D
A transformação de textos em números, como vetores ou matrizes, é essencial no Processamento de Linguagem Natural (PLN) para que algoritmos de aprendizado de máquina possam processá-los, criando representações numéricas que capturam o significado ou as características do texto.
- (A) Incorreta: A afirmação de que TF-IDF "normaliza essa informação" (referindo-se ao BoW) é imprecisa. BoW gera vetores de contagens de frequência. TF-IDF é um esquema de ponderação distinto que calcula um score para cada palavra, multiplicando a frequência do termo no documento (TF) pela frequência inversa do documento (IDF), que mede a raridade da palavra no corpus. Não é uma simples normalização do BoW, mas uma representação diferente e mais sofisticada.
- (B) Incorreta: Os vetores de word embeddings do Word2Vec representam semanticamente a palavra central que está sendo processada, e não as "palavras vizinhas". As palavras vizinhas (o contexto) são usadas para aprender a representação vetorial da palavra central, de modo que palavras com significados semelhantes (e, portanto, contextos semelhantes) fiquem próximas no espaço vetorial.
- (C) Incorreta: Embora o Glove utilize uma matriz de co-ocorrência (que reflete estatísticas globais) e a construção dessa matriz envolva janelas de contexto (capturando aspectos locais), a descrição de que "combina estatísticas locais com estatísticas globais" pode ser considerada conceitualmente imprecisa em um sentido estrito. O Glove otimiza um modelo para capturar as relações de co-ocorrência global, que são derivadas de contextos locais, mas não "combina" dois tipos de estatísticas ou modelos de forma separada em sua função objetivo. A armadilha aqui é que essa frase é uma descrição comum, mas pode ser vista como uma simplificação excessiva.
- (D) Correta: O algoritmo Word2Vec de fato possui duas arquiteturas principais: CBOW (Continuous Bag of Words), que prevê uma palavra-alvo dado seu contexto, e Skip-Gram, que prevê o contexto (palavras vizinhas) dada uma palavra-alvo. Ambas utilizam redes neurais para aprender as representações vetoriais das palavras.
- (E) Incorreta: A frase "o valor será mais alto do que o contrário" é vaga e não é uma propriedade inerente da matriz de co-ocorrência. Os valores na matriz são simplesmente contagens de quantas vezes uma palavra co-ocorre com outra dentro de um contexto. Além disso, a correlação entre quaisquer palavras é calculada a partir dos embeddings (vetores) aprendidos a partir da matriz de co-ocorrência, e não diretamente da matriz para "esse contexto" específico.
Fonte: FGV CGE-SC 2022 Auditor do Estado - Ciências da Computação (Caderno Tipo 1). Reproduzida para fins de estudo.