Questão nº 41
Questão de Conhecimentos Específicos · FCC TRF4 2025 (nº 41)
No decorrer do desenvolvimento de um sistema de suporte à decisão baseado em técnicas de aprendizado de máquina, a equipe de analistas de um tribunal identificou a necessidade de aplicar técnicas de pré-processamento aos dados disponíveis, que incluíam tanto registros tabulares quanto documentos em texto livre. Considerando as práticas de preparação de dados para algoritmos de IA/ML, o pré-processamento de dados estruturados e não estruturados consiste, respectivamente, em atividades como
- Acompressão de arquivos e criptografia de registros.
- Bnormalização de variáveis e tokenização de textos. (alternativa correta)
- Cexecução de auditoria de sistemas e clusterização de bases.
- Dautenticação de usuários e mineração de dados sensíveis.
- Eimplementação de redes neurais e classificação supervisionada.
Resposta comentada
Gabarito Alternativa B
O pré-processamento de dados é a etapa de limpeza e transformação dos dados brutos para que se tornem adequados e eficientes para serem usados por algoritmos de aprendizado de máquina.
- (A) Incorreta: Compressão de arquivos visa reduzir o tamanho do arquivo para armazenamento ou transmissão, não é uma técnica de preparação do conteúdo dos dados para um algoritmo de ML. Criptografia de registros é uma medida de segurança para proteger os dados, não uma etapa de pré-processamento para o treinamento de modelos.
- (B) Correta: Normalização de variáveis é uma técnica essencial para dados estruturados (numéricos), que escala os valores das características para uma faixa padrão (ex: 0 a 1), ajudando algoritmos a performar melhor. Tokenização de textos é o processo de dividir um texto em unidades menores (palavras, frases) chamadas tokens, sendo um passo fundamental para transformar texto livre (dados não estruturados) em um formato que pode ser processado por modelos de ML.
- (C) Incorreta: Execução de auditoria de sistemas é uma prática de verificação de conformidade ou segurança de sistemas, não de pré-processamento de dados. Clusterização de bases é um algoritmo de aprendizado não supervisionado (uma técnica de ML em si), não uma etapa de pré-processamento para preparar os dados para outro algoritmo. Armadilha: A banca pode tentar confundir técnicas de ML com pré-processamento.
- (D) Incorreta: Autenticação de usuários é um mecanismo de segurança para verificar a identidade de quem acessa o sistema, não uma técnica de pré-processamento de dados. Mineração de dados sensíveis é uma atividade que pode envolver técnicas de ML para identificar padrões em dados, mas não é uma técnica de pré-processamento que transforma os dados para uso em um algoritmo.
- (E) Incorreta: Implementação de redes neurais é a escolha ou desenvolvimento de um tipo de modelo de aprendizado de máquina. Classificação supervisionada é um tipo de tarefa de aprendizado de máquina (o objetivo do modelo), não uma técnica de pré-processamento. Ambas são etapas que ocorrem após o pré-processamento dos dados.
Fonte: FCC TRF4 2025 Analista Judiciário - Área Apoio Especializado - Especialidade Análise de Sistemas de Informação (Caderno Tipo 001). Reproduzida para fins de estudo.