Questão nº 57
Questão de Tecnologia da Informação · FGV TRF1 2024 (nº 57)
FGV2024Analista Judiciário - Análise de DadosTecnologia da Informação
Gabarito: Bver comentário ↓
Carolina produz um relatório em que compara os modelos de representação vetorial de palavras Word2Vec (em seus dois métodos: CBOW e Skip-Gram) e GloVe.
Em seu relatório, Carolina destaca corretamente que o:
- AWord2Vec é treinado usando uma rede neural profunda;
- BGloVe consegue capturar correlações globais, além das locais; (alternativa correta)
- CCBOW utiliza técnicas de fatoração de matrizes para aprender os vetores;
- DSkip-gram prevê a palavra que melhor se encaixa em um contexto apresentado;
- EWord2Vec necessita de mais memória de armazenamento durante o treinamento do que o GloVe.
Resposta comentada
Gabarito Alternativa B
Word embeddings (representação vetorial de palavras) transformam palavras em sequências de números (vetores) para que computadores possam processá-las e entender suas relações de significado. Word2Vec e GloVe são modelos populares que criam esses vetores.
- (A) Incorreta: Word2Vec é treinado usando uma rede neural rasa (shallow neural network), não uma rede neural profunda. Sua arquitetura é simples, focando em aprender as representações eficientes.
- (B) Correta: GloVe (Global Vectors for Word Representation) é projetado para capturar tanto as correlações locais (baseadas em janelas de contexto, como o Word2Vec) quanto as correlações globais (baseadas em estatísticas de co-ocorrência de todo o corpus), combinando as vantagens de ambos os tipos de abordagens.
- (C) Incorreta: CBOW (Continuous Bag-of-Words) é um dos métodos do Word2Vec e é baseado em redes neurais para prever uma palavra a partir de seu contexto. Técnicas de fatoração de matrizes são mais associadas a modelos como LSA (Latent Semantic Analysis) ou ao próprio GloVe, mas não ao CBOW.
- (D) Incorreta: O Skip-gram faz o oposto: ele prevê as palavras do contexto dada uma palavra-alvo. Quem prevê a palavra-alvo a partir de um contexto apresentado é o CBOW. A armadilha aqui é a inversão das funções dos dois métodos do Word2Vec.
- (E) Incorreta: Geralmente, o GloVe pode necessitar de mais memória de armazenamento durante o treinamento do que o Word2Vec, pois ele constrói e armazena uma matriz de co-ocorrência global, que pode ser muito grande para vocabulários extensos. O Word2Vec treina iterativamente em janelas de contexto, sem a necessidade de manter essa matriz global na memória.
Fonte: FGV TRF1 2024 Analista Judiciário - Análise de Dados (Caderno Tipo 1). Reproduzida para fins de estudo.