Questão nº 74

Questão de Análise de Dados · FGV TCU 2021 (nº 74)

FGV2021Auditor Federal de Controle Externo - Área Controle Externo (AUFC-CE)Análise de Dados
Gabarito: Dver comentário ↓

Uma organização está implementando um sistema de busca de informações interno, e a equipe de desenvolvimento resolveu avaliar diferentes modelos de linguagem vetoriais que ajudariam a conectar melhor documentos e consultas em departamentos que usam terminologias distintas em áreas de negócio que se sobrepõem. Um dos analistas ressaltou que seria interessante guardar os vetores de todo o vocabulário do modelo em um cache, de forma a aumentar a eficiência de acesso e reduzir certos custos de implantação.
Das alternativas abaixo, aquela que lista apenas os modelos compatíveis com essa estratégia de caching é:

Resposta comentada

Gabarito Alternativa D

Embeddings estáticos são vetores fixos para cada palavra, independentemente do contexto em que aparecem, permitindo que sejam pré-calculados e armazenados em cache. Já os embeddings contextuais geram vetores diferentes para a mesma palavra dependendo da frase, tornando inviável o cache de um vetor único para cada palavra do vocabulário.

  • (A) Incorreta: TF-IDF pode ter seus "vetores" (pontuações) cacheados, mas BERT é um modelo contextual, e seus vetores de palavras mudam com o contexto, não sendo adequado para cache de vetores fixos por palavra.
  • (B) Incorreta: Word2Vec é estático e pode ser cacheado, mas BERT e GPT-2 são modelos contextuais, onde o vetor de uma palavra varia conforme a frase, impossibilitando o cache de um vetor único para cada palavra.
  • (C) Incorreta: GloVe é estático e pode ser cacheado, mas GPT-2 é um modelo contextual, não permitindo o cache de vetores fixos por palavra.
  • (D) Correta: Word2Vec e GloVe são modelos de embeddings estáticos. Isso significa que cada palavra do vocabulário tem um vetor fixo e pré-definido, que não muda com o contexto. Essa característica os torna ideais para serem pré-calculados e armazenados em um cache para acesso rápido e eficiente.
  • (E) Incorreta: GPT-2 e BERT são modelos de embeddings contextuais (baseados em Transformers). A "armadilha" aqui é que, embora sejam poderosos, seus vetores de palavras são gerados dinamicamente e dependem do contexto da frase. Portanto, não é possível armazenar em cache um único vetor para cada palavra do vocabulário, pois o vetor de uma palavra como "banco" será diferente em "banco de areia" e "banco financeiro". O que se cacheia é o modelo em si, não os vetores fixos das palavras.

Fonte: FGV TCU 2021 Auditor Federal de Controle Externo - Área Controle Externo (AUFC-CE) (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho