Questão nº 65
Questão de Tecnologia da Informação · FGV TCE-PA 2024 (nº 65)
As arquiteturas de modelos de linguagem de larga escala (Large Language Models – LLM) surgiram recentemente, revolucionando a área de inteligência artificial nas áreas de processamento e geração de texto. A arquitetura desses modelos baseia-se, majoritariamente, nas redes neurais do tipo transformers.
Relacione as arquiteturas a seguir as suas características principais.
- BERT
- GPT
- T5
( ) Utiliza decoders das redes transformer para prever novos tokens a partir de uma sequência, tornando-se ideal para a geração de textos.
( ) Utiliza encoders das redes transformer para "entender" o contexto de frases, tornando-se ideal para classificação de textos.
( ) Utiliza encoders e decoders das redes transformer, sendo adaptável a situações em que seja necessário gerar novos textos ou processar textos para "entender" o contexto das frases.
( ) Em comparação com as outras arquiteturas, tem menor necessidade de fine-tuning para melhora de performance.
A relação correta, na ordem apresentada, é
- A1 – 3 – 2 – 2.
- B2 – 3 – 1 – 3.
- C3 – 2 – 1 – 2.
- D3 – 1 – 2 – 2.
- E2 – 1 – 3 – 3. (alternativa correta)
Resposta comentada
Gabarito Alternativa E
Modelos de Linguagem de Larga Escala (LLMs) são programas de computador que usam redes neurais para entender e gerar texto. Eles são construídos principalmente com uma arquitetura chamada transformer, que pode ser dividida em três tipos principais: encoder-only (para entender texto), decoder-only (para gerar texto) e encoder-decoder (para ambos).
- A) Incorreta: A sequência 1 – 3 – 2 – 2 não corresponde à correta atribuição das características aos modelos.
- B) Incorreta: A sequência 2 – 3 – 1 – 3 não corresponde à correta atribuição das características aos modelos.
- C) Incorreta: A sequência 3 – 2 – 1 – 2 não corresponde à correta atribuição das características aos modelos.
- D) Incorreta: A sequência 3 – 1 – 2 – 2 não corresponde à correta atribuição das características aos modelos.
- (E) Correta: A sequência 2 – 1 – 3 – 3 está correta.
- A primeira característica ("Utiliza decoders das redes transformer para prever novos tokens a partir de uma sequência, tornando-se ideal para a geração de textos") descreve o GPT (2), que é um modelo decoder-only, focado em geração de texto sequencial.
- A segunda característica ("Utiliza encoders das redes transformer para "entender" o contexto de frases, tornando-se ideal para classificação de textos") descreve o BERT (1), que é um modelo encoder-only, focado em compreensão bidirecional e tarefas de classificação.
- A terceira característica ("Utiliza encoders e decoders das redes transformer, sendo adaptável a situações em que seja necessário gerar novos textos ou processar textos para "entender" o contexto das frases") descreve o T5 (3), que é um modelo encoder-decoder (ou sequência-a-sequência), versátil para ambas as tarefas ao unificar todas as tarefas de PNL em um formato texto-a-texto.
- A quarta característica ("Em comparação com as outras arquiteturas, tem menor necessidade de fine-tuning para melhora de performance") também descreve o T5 (3). Embora modelos GPT sejam conhecidos por suas capacidades few-shot e zero-shot (menor necessidade de fine-tuning para novas tarefas com base em prompts), o T5, com sua abordagem unificada "text-to-text" para todas as tarefas de PNL, é projetado para transferência de aprendizado eficiente. Isso significa que ele pode ser adaptado a uma ampla gama de tarefas com menos esforço de fine-tuning específico para cada tarefa ou com menos dados, devido à sua pré-treinamento abrangente e à sua arquitetura que unifica a entrada e saída de texto. A armadilha da banca aqui é que a frase pode levar o aluno a pensar imediatamente no GPT devido à sua fama de few-shot learning, mas o T5 também se destaca na eficiência de fine-tuning para transferência entre diversas tarefas devido à sua arquitetura unificada.
Fonte: FGV TCE-PA 2024 Auditor de Controle Externo - Informática - Analista de Sistemas (Caderno Tipo 1). Reproduzida para fins de estudo.