Questão nº 53

Questão de Análise de Informação · FGV CGE-SC 2022 (nº 53)

FGV2022Auditor do Estado - Ciências da ComputaçãoAnálise de Informação
Gabarito: Dver comentário ↓

No processamento de linguagem natural, é preciso realizar transformações de textos em números, geralmente vetores ou matrizes, de forma que sirvam de entrada para os algoritmos computacionais de aprendizado de máquina.
Sobre esses algoritmos de extração de características de textos, assinale a afirmativa incorreta.

Resposta comentada

Gabarito Alternativa D

A transformação de textos em números, como vetores ou matrizes, é essencial no Processamento de Linguagem Natural (PLN) para que algoritmos de aprendizado de máquina possam processá-los, criando representações numéricas que capturam o significado ou as características do texto.

  • (A) Incorreta: A afirmação de que TF-IDF "normaliza essa informação" (referindo-se ao BoW) é imprecisa. BoW gera vetores de contagens de frequência. TF-IDF é um esquema de ponderação distinto que calcula um score para cada palavra, multiplicando a frequência do termo no documento (TF) pela frequência inversa do documento (IDF), que mede a raridade da palavra no corpus. Não é uma simples normalização do BoW, mas uma representação diferente e mais sofisticada.
  • (B) Incorreta: Os vetores de word embeddings do Word2Vec representam semanticamente a palavra central que está sendo processada, e não as "palavras vizinhas". As palavras vizinhas (o contexto) são usadas para aprender a representação vetorial da palavra central, de modo que palavras com significados semelhantes (e, portanto, contextos semelhantes) fiquem próximas no espaço vetorial.
  • (C) Incorreta: Embora o Glove utilize uma matriz de co-ocorrência (que reflete estatísticas globais) e a construção dessa matriz envolva janelas de contexto (capturando aspectos locais), a descrição de que "combina estatísticas locais com estatísticas globais" pode ser considerada conceitualmente imprecisa em um sentido estrito. O Glove otimiza um modelo para capturar as relações de co-ocorrência global, que são derivadas de contextos locais, mas não "combina" dois tipos de estatísticas ou modelos de forma separada em sua função objetivo. A armadilha aqui é que essa frase é uma descrição comum, mas pode ser vista como uma simplificação excessiva.
  • (D) Correta: O algoritmo Word2Vec de fato possui duas arquiteturas principais: CBOW (Continuous Bag of Words), que prevê uma palavra-alvo dado seu contexto, e Skip-Gram, que prevê o contexto (palavras vizinhas) dada uma palavra-alvo. Ambas utilizam redes neurais para aprender as representações vetoriais das palavras.
  • (E) Incorreta: A frase "o valor será mais alto do que o contrário" é vaga e não é uma propriedade inerente da matriz de co-ocorrência. Os valores na matriz são simplesmente contagens de quantas vezes uma palavra co-ocorre com outra dentro de um contexto. Além disso, a correlação entre quaisquer palavras é calculada a partir dos embeddings (vetores) aprendidos a partir da matriz de co-ocorrência, e não diretamente da matriz para "esse contexto" específico.

Fonte: FGV CGE-SC 2022 Auditor do Estado - Ciências da Computação (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho