Questão nº 88
Questão de Ciência de Dados · FGV TCE-PA 2024 (nº 88)
As arquiteturas de modelos de linguagem de larga escala (Large Language Models - LLM) surgiram recentemente, revolucionando a área de inteligência artificial nas áreas de processamento e geração de texto.
A arquitetura desses modelos baseia-se, majoritariamente, nas redes neurais do tipo transformers. Relacione as arquiteturas a seguir com suas características principais:
- BERT
- GPT
- T5
( ) Utiliza decoders das redes transformer para prever novos tokens a partir de uma sequência, tornando-se ideal para a geração de textos.
( ) Utiliza encoders das redes transformer para "entender" o contexto de frases, tornando-se ideal para classificação de textos.
( ) Utiliza encoders e decoders das redes transformer, sendo adaptável a situações em que seja necessário gerar novos textos ou processar textos para "entender" o contexto das frases.
( ) Em comparação com as outras arquiteturas, tem menor necessidade de fine-tuning para melhora de performance.
A relação correta, na ordem apresentada, é
- A1 – 3 – 2 – 2.
- B2 – 3 – 1 – 3.
- C3 – 2 – 1 – 2.
- D3 – 1 – 2 – 2.
- E2 – 1 – 3 – 3. (alternativa correta)
Resposta comentada
Gabarito Alternativa E
Modelos de Linguagem de Larga Escala (LLMs) são programas de computador que usam redes neurais, principalmente baseadas na arquitetura Transformer, para entender e criar texto. A arquitetura Transformer tem duas partes principais: o Encoder (codificador), que processa a entrada para entender seu significado, e o Decoder (decodificador), que gera a saída.
- (A) Incorreta: A sequência 1 – 3 – 2 – 2 não corresponde à relação correta entre as arquiteturas e suas características.
- (B) Incorreta: A sequência 2 – 3 – 1 – 3 não corresponde à relação correta entre as arquiteturas e suas características.
- (C) Incorreta: A sequência 3 – 2 – 1 – 2 não corresponde à relação correta entre as arquiteturas e suas características.
- (D) Incorreta: A sequência 3 – 1 – 2 – 2 não corresponde à relação correta entre as arquiteturas e suas características.
- (E) Correta: A relação correta é 2 – 1 – 3 – 3.
- (2) GPT: Utiliza decoders das redes transformer para prever novos tokens a partir de uma sequência, tornando-se ideal para a geração de textos. (O GPT, ou Generative Pre-trained Transformer, é uma arquitetura decoder-only, focada em gerar texto sequencialmente, prevendo a próxima palavra ou token.)
- (1) BERT: Utiliza encoders das redes transformer para "entender" o contexto de frases, tornando-se ideal para classificação de textos. (O BERT, ou Bidirectional Encoder Representations from Transformers, é uma arquitetura encoder-only, projetada para compreender profundamente o contexto bidirecional de uma frase, sendo excelente para tarefas de entendimento como classificação, análise de sentimento e resposta a perguntas.)
- (3) T5: Utiliza encoders e decoders das redes transformer, sendo adaptável a situações em que seja necessário gerar novos textos ou processar textos para "entender" o contexto das frases. (O T5, ou Text-to-Text Transfer Transformer, é uma arquitetura encoder-decoder, que reformula todas as tarefas de Processamento de Linguagem Natural como um problema de "texto para texto", tornando-o extremamente versátil para tarefas de geração e compreensão.)
- (3) T5: Em comparação com as outras arquiteturas, tem menor necessidade de fine-tuning para melhora de performance. (A arquitetura T5, ao unificar todas as tarefas de PLN no formato texto-para-texto, é projetada para ser altamente adaptável e generalizável, o que pode reduzir a necessidade de fine-tuning extensivo e específico para cada nova tarefa, em comparação com outras arquiteturas que podem exigir modificações mais substanciais ou heads de saída diferentes para cada tipo de tarefa. A armadilha da banca aqui é que modelos GPT muito grandes também são conhecidos por suas capacidades de zero-shot e few-shot learning, reduzindo a necessidade de fine-tuning. No entanto, a filosofia de design do T5 de unificar tarefas é um ponto chave para sua adaptabilidade e menor necessidade de fine-tuning específico de tarefa.)
Fonte: FGV TCE-PA 2024 Auditor de Controle Externo - Administrativa - Ciência de Dados (Caderno Tipo 1). Reproduzida para fins de estudo.