Questão nº 26

Questão de Tecnologia da Informação · FCC TRT15 2024 (nº 26)

FCC2024Analista Judiciário - Área Apoio Especializado - Especialidade Tecnologia da InformaçãoTecnologia da Informação
Gabarito: Cver comentário ↓

Uma equipe está trabalhando em um projeto de análise preditiva com base em dados estruturados provenientes de diferentes fontes de um Tribunal Regional do Trabalho. Durante a etapa de pré-processamento, o time precisa lidar com valores ausentes/faltantes, escalonar os dados para uniformizar as unidades e selecionar as variáveis mais importantes para treinar um modelo supervisionado. Para realizar estas tarefas nesta etapa, a equipe deve

Resposta comentada

Gabarito Alternativa C

O pré-processamento de dados é a etapa de preparação dos dados brutos para que um modelo de Machine Learning possa aprender de forma eficaz. Isso envolve limpar, transformar e organizar os dados para extrair o máximo de informação.

  • A) Incorreta: CNNs são para dados com estrutura espacial (imagens), não para imputação de valores ausentes em dados tabulares. PCA é para redução de dimensionalidade, não para normalização (escalonamento), e regressão logística é um modelo de classificação, não uma técnica de redução de dimensionalidade.
  • B) Incorreta: CNNs não são usadas para escalonar dados tabulares. O algoritmo k-means é para clusterização (agrupamento), não para identificar a importância de variáveis para um modelo supervisionado.
  • (C) Correta: Preencher valores ausentes com a média ou mediana é uma técnica comum e eficaz de imputação. Standard Scaler é um método padrão para escalonar dados, transformando-os para ter média zero e desvio padrão um. A importância de features calculada por um modelo de árvore de decisão (como Random Forest ou Gradient Boosting) é um método robusto e amplamente utilizado para selecionar as variáveis mais relevantes para um modelo supervisionado.
  • D) Incorreta: Remover todas as linhas com valores ausentes pode levar à perda excessiva de dados. SVD (Singular Value Decomposition) é uma técnica de redução de dimensionalidade, não de normalização (escalonamento). O algoritmo k-means é para clusterização, não para seleção de variáveis. Armadilha da banca: Esta alternativa usa termos técnicos conhecidos (SVD, k-means) que são associados a pré-processamento, mas os aplica de forma incorreta às tarefas específicas de normalização e seleção de variáveis para um modelo supervisionado.
  • E) Incorreta: A Análise de Cluster Hierárquico (HCA) é um algoritmo de clusterização (não supervisionado), não sendo adequado para prever ou imputar valores ausentes. Embora a normalização z-score esteja correta (é o mesmo que Standard Scaler), calcular a importância de variáveis com uma rede neural profunda é uma abordagem mais complexa e menos direta do que métodos baseados em árvores para essa finalidade específica.

Fonte: FCC TRT15 2024 Analista Judiciário - Área Apoio Especializado - Especialidade Tecnologia da Informação (Caderno Tipo 001). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho