Questão nº 57

Questão de Ciência de Dados · FCC TRT6 2025 (nº 57)

FCC2025Analista Judiciário - Área Apoio Especializado - Especialidade Tecnologia da InformaçãoCiência de Dados
Gabarito: Cver comentário ↓

Uma equipe de Analistas está implementando um modelo LLM para uso no Tribunal Regional do Trabalho e precisa garantir que o modelo não gere respostas inapropriadas ou incorretas, mantendo a relevância e coerência do conteúdo. Para ajustar o desempenho do modelo e evitar problemas como alucinações e vieses, eles optaram por

Resposta comentada

Gabarito Alternativa C

RLHF (Reinforcement Learning from Human Feedback) é uma técnica que usa o feedback de pessoas para ensinar um modelo de linguagem (LLM) a gerar respostas mais úteis, honestas e inofensivas, corrigindo seus erros e alinhando seu comportamento com as expectativas humanas.

  • (A) Incorreta: Reduzir camadas de rede neural geralmente diminui a capacidade do modelo de aprender padrões complexos, o que pode aumentar erros e não resolve problemas de alucinações ou vieses, que são mais sobre o conteúdo e alinhamento.
  • (B) Incorreta: Aprendizado zero-shot é a capacidade do modelo de responder a tarefas para as quais não foi explicitamente treinado, usando seu conhecimento prévio. Usá-lo durante o treinamento como solução para evitar respostas inapropriadas ou incorretas é um equívoco; ele não é um método de ajuste fino para alinhamento de segurança ou correção de vieses.
  • (C) Correta: RLHF é a técnica padrão e mais eficaz para alinhar modelos LLM com valores humanos, reduzir alucinações, vieses e gerar respostas mais seguras e relevantes, exatamente como a equipe precisa para um contexto jurídico sensível.
  • (D) Incorreta: Fine-tuning com um conjunto de dados menor e mais específico é uma boa prática, mas a condição "sem utilizar nenhum mecanismo de atenção" é a armadilha. Mecanismos de atenção são componentes fundamentais dos LLMs modernos (como os Transformers) e são cruciais para o modelo entender o contexto e a relevância das palavras. Removê-los degradaria severamente o desempenho e a coerência, tornando o modelo inútil.
  • (E) Incorreta: Aumentar o número de tokens e embeddings durante o treinamento refere-se a dar mais dados contextuais ou representações mais ricas, o que é bom para a capacidade geral do modelo, mas não aborda diretamente a correção de respostas inapropriadas, alucinações ou vieses de forma direcionada e alinhada com feedback humano, como o RLHF faz.

Fonte: FCC TRT6 2025 Analista Judiciário - Área Apoio Especializado - Especialidade Tecnologia da Informação (Caderno Tipo 005). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho