Questão nº 57
Questão de Ciência de Dados · FCC TRT6 2025 (nº 57)
Uma equipe de Analistas está implementando um modelo LLM para uso no Tribunal Regional do Trabalho e precisa garantir que o modelo não gere respostas inapropriadas ou incorretas, mantendo a relevância e coerência do conteúdo. Para ajustar o desempenho do modelo e evitar problemas como alucinações e vieses, eles optaram por
- Areduzir o número de camadas de rede neural para minimizar o processamento e aumentar a velocidade de inferência, pois isso reduziria erros causados por dados não estruturados.
- Busar o aprendizado zero-shot durante o treinamento, pois ele é suficiente para que o modelo aprenda a generalizar padrões sem supervisão.
- Cutilizar Reinforcement Learning from Human Feedback (RLHF) para treinar o modelo a partir de respostas corrigidas por humanos. (alternativa correta)
- Dimplementar fine-tuning com um conjunto de dados menor e mais específico, sem utilizar nenhum mecanismo de atenção para evitar sobrecarga de processamento.
- Eaumentar o número de tokens e embeddings durante o treinamento para que o modelo tenha mais dados contextuais disponíveis.
Resposta comentada
Gabarito Alternativa C
RLHF (Reinforcement Learning from Human Feedback) é uma técnica que usa o feedback de pessoas para ensinar um modelo de linguagem (LLM) a gerar respostas mais úteis, honestas e inofensivas, corrigindo seus erros e alinhando seu comportamento com as expectativas humanas.
- (A) Incorreta: Reduzir camadas de rede neural geralmente diminui a capacidade do modelo de aprender padrões complexos, o que pode aumentar erros e não resolve problemas de alucinações ou vieses, que são mais sobre o conteúdo e alinhamento.
- (B) Incorreta: Aprendizado zero-shot é a capacidade do modelo de responder a tarefas para as quais não foi explicitamente treinado, usando seu conhecimento prévio. Usá-lo durante o treinamento como solução para evitar respostas inapropriadas ou incorretas é um equívoco; ele não é um método de ajuste fino para alinhamento de segurança ou correção de vieses.
- (C) Correta: RLHF é a técnica padrão e mais eficaz para alinhar modelos LLM com valores humanos, reduzir alucinações, vieses e gerar respostas mais seguras e relevantes, exatamente como a equipe precisa para um contexto jurídico sensível.
- (D) Incorreta: Fine-tuning com um conjunto de dados menor e mais específico é uma boa prática, mas a condição "sem utilizar nenhum mecanismo de atenção" é a armadilha. Mecanismos de atenção são componentes fundamentais dos LLMs modernos (como os Transformers) e são cruciais para o modelo entender o contexto e a relevância das palavras. Removê-los degradaria severamente o desempenho e a coerência, tornando o modelo inútil.
- (E) Incorreta: Aumentar o número de tokens e embeddings durante o treinamento refere-se a dar mais dados contextuais ou representações mais ricas, o que é bom para a capacidade geral do modelo, mas não aborda diretamente a correção de respostas inapropriadas, alucinações ou vieses de forma direcionada e alinhada com feedback humano, como o RLHF faz.
Fonte: FCC TRT6 2025 Analista Judiciário - Área Apoio Especializado - Especialidade Tecnologia da Informação (Caderno Tipo 005). Reproduzida para fins de estudo.