Questão nº 88

Questão de Ciência de Dados · FGV TCE-PA 2024 (nº 88)

FGV2024Auditor de Controle Externo - Administrativa - Ciência de DadosCiência de Dados
Gabarito: Ever comentário ↓

As arquiteturas de modelos de linguagem de larga escala (Large Language Models - LLM) surgiram recentemente, revolucionando a área de inteligência artificial nas áreas de processamento e geração de texto.
A arquitetura desses modelos baseia-se, majoritariamente, nas redes neurais do tipo transformers. Relacione as arquiteturas a seguir com suas características principais:

  1. BERT
  2. GPT
  3. T5
    ( ) Utiliza decoders das redes transformer para prever novos tokens a partir de uma sequência, tornando-se ideal para a geração de textos.
    ( ) Utiliza encoders das redes transformer para "entender" o contexto de frases, tornando-se ideal para classificação de textos.
    ( ) Utiliza encoders e decoders das redes transformer, sendo adaptável a situações em que seja necessário gerar novos textos ou processar textos para "entender" o contexto das frases.
    ( ) Em comparação com as outras arquiteturas, tem menor necessidade de fine-tuning para melhora de performance.
    A relação correta, na ordem apresentada, é

Resposta comentada

Gabarito Alternativa E

Modelos de Linguagem de Larga Escala (LLMs) são programas de computador que usam redes neurais, principalmente baseadas na arquitetura Transformer, para entender e criar texto. A arquitetura Transformer tem duas partes principais: o Encoder (codificador), que processa a entrada para entender seu significado, e o Decoder (decodificador), que gera a saída.

  • (A) Incorreta: A sequência 1 – 3 – 2 – 2 não corresponde à relação correta entre as arquiteturas e suas características.
  • (B) Incorreta: A sequência 2 – 3 – 1 – 3 não corresponde à relação correta entre as arquiteturas e suas características.
  • (C) Incorreta: A sequência 3 – 2 – 1 – 2 não corresponde à relação correta entre as arquiteturas e suas características.
  • (D) Incorreta: A sequência 3 – 1 – 2 – 2 não corresponde à relação correta entre as arquiteturas e suas características.
  • (E) Correta: A relação correta é 2 – 1 – 3 – 3.
    • (2) GPT: Utiliza decoders das redes transformer para prever novos tokens a partir de uma sequência, tornando-se ideal para a geração de textos. (O GPT, ou Generative Pre-trained Transformer, é uma arquitetura decoder-only, focada em gerar texto sequencialmente, prevendo a próxima palavra ou token.)
    • (1) BERT: Utiliza encoders das redes transformer para "entender" o contexto de frases, tornando-se ideal para classificação de textos. (O BERT, ou Bidirectional Encoder Representations from Transformers, é uma arquitetura encoder-only, projetada para compreender profundamente o contexto bidirecional de uma frase, sendo excelente para tarefas de entendimento como classificação, análise de sentimento e resposta a perguntas.)
    • (3) T5: Utiliza encoders e decoders das redes transformer, sendo adaptável a situações em que seja necessário gerar novos textos ou processar textos para "entender" o contexto das frases. (O T5, ou Text-to-Text Transfer Transformer, é uma arquitetura encoder-decoder, que reformula todas as tarefas de Processamento de Linguagem Natural como um problema de "texto para texto", tornando-o extremamente versátil para tarefas de geração e compreensão.)
    • (3) T5: Em comparação com as outras arquiteturas, tem menor necessidade de fine-tuning para melhora de performance. (A arquitetura T5, ao unificar todas as tarefas de PLN no formato texto-para-texto, é projetada para ser altamente adaptável e generalizável, o que pode reduzir a necessidade de fine-tuning extensivo e específico para cada nova tarefa, em comparação com outras arquiteturas que podem exigir modificações mais substanciais ou heads de saída diferentes para cada tipo de tarefa. A armadilha da banca aqui é que modelos GPT muito grandes também são conhecidos por suas capacidades de zero-shot e few-shot learning, reduzindo a necessidade de fine-tuning. No entanto, a filosofia de design do T5 de unificar tarefas é um ponto chave para sua adaptabilidade e menor necessidade de fine-tuning específico de tarefa.)

Fonte: FGV TCE-PA 2024 Auditor de Controle Externo - Administrativa - Ciência de Dados (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho