Questão nº 74
Questão de Análise de Dados · FGV TCU 2021 (nº 74)
Uma organização está implementando um sistema de busca de informações interno, e a equipe de desenvolvimento resolveu avaliar diferentes modelos de linguagem vetoriais que ajudariam a conectar melhor documentos e consultas em departamentos que usam terminologias distintas em áreas de negócio que se sobrepõem. Um dos analistas ressaltou que seria interessante guardar os vetores de todo o vocabulário do modelo em um cache, de forma a aumentar a eficiência de acesso e reduzir certos custos de implantação.
Das alternativas abaixo, aquela que lista apenas os modelos compatíveis com essa estratégia de caching é:
- ATF-IDF, BERT
- BWord2Vec, BERT, GPT-2
- CGloVe, GPT-2
- DWord2Vec, GloVe (alternativa correta)
- EGPT-2, BERT
Resposta comentada
Gabarito Alternativa D
Embeddings estáticos são vetores fixos para cada palavra, independentemente do contexto em que aparecem, permitindo que sejam pré-calculados e armazenados em cache. Já os embeddings contextuais geram vetores diferentes para a mesma palavra dependendo da frase, tornando inviável o cache de um vetor único para cada palavra do vocabulário.
- (A) Incorreta: TF-IDF pode ter seus "vetores" (pontuações) cacheados, mas BERT é um modelo contextual, e seus vetores de palavras mudam com o contexto, não sendo adequado para cache de vetores fixos por palavra.
- (B) Incorreta: Word2Vec é estático e pode ser cacheado, mas BERT e GPT-2 são modelos contextuais, onde o vetor de uma palavra varia conforme a frase, impossibilitando o cache de um vetor único para cada palavra.
- (C) Incorreta: GloVe é estático e pode ser cacheado, mas GPT-2 é um modelo contextual, não permitindo o cache de vetores fixos por palavra.
- (D) Correta: Word2Vec e GloVe são modelos de embeddings estáticos. Isso significa que cada palavra do vocabulário tem um vetor fixo e pré-definido, que não muda com o contexto. Essa característica os torna ideais para serem pré-calculados e armazenados em um cache para acesso rápido e eficiente.
- (E) Incorreta: GPT-2 e BERT são modelos de embeddings contextuais (baseados em Transformers). A "armadilha" aqui é que, embora sejam poderosos, seus vetores de palavras são gerados dinamicamente e dependem do contexto da frase. Portanto, não é possível armazenar em cache um único vetor para cada palavra do vocabulário, pois o vetor de uma palavra como "banco" será diferente em "banco de areia" e "banco financeiro". O que se cacheia é o modelo em si, não os vetores fixos das palavras.
Fonte: FGV TCU 2021 Auditor Federal de Controle Externo - Área Controle Externo (AUFC-CE) (Caderno Tipo 1). Reproduzida para fins de estudo.