Questão nº 26
Questão de Tecnologia da Informação · FCC TRT15 2024 (nº 26)
Uma equipe está trabalhando em um projeto de análise preditiva com base em dados estruturados provenientes de diferentes fontes de um Tribunal Regional do Trabalho. Durante a etapa de pré-processamento, o time precisa lidar com valores ausentes/faltantes, escalonar os dados para uniformizar as unidades e selecionar as variáveis mais importantes para treinar um modelo supervisionado. Para realizar estas tarefas nesta etapa, a equipe deve
- Autilizar uma Convolutional Neural Network (CNN) para preencher valores ausentes, normalizar os dados com a técnica Principal Component Analysis (PCA) e realizar redução dimensional com regressão logística.
- Baplicar a imputação de valores ausentes, escalonar os dados utilizando-se CNN e identificar variáveis importantes por meio da análise de cluster k-means.
- Cpreencher os valores ausentes com imputação (média ou mediana), escalonar os dados com standard scaler e realizar a seleção de variáveis com base na importância de features calculada por um modelo de árvore de decisão. (alternativa correta)
- Dremover diretamente todas as linhas com valores ausentes, normalizar os dados com decomposição em valores singulares (SVD) e utilizar o algoritmo k-means para selecionar variáveis mais relevantes.
- Eusar o algoritmo supervisionado análise de cluster hierárquico (HCA) para prever valores ausentes, aplicar normalização z-score nos dados e calcular a importância das variáveis com uma rede neural profunda.
Resposta comentada
Gabarito Alternativa C
O pré-processamento de dados é a etapa de preparação dos dados brutos para que um modelo de Machine Learning possa aprender de forma eficaz. Isso envolve limpar, transformar e organizar os dados para extrair o máximo de informação.
- A) Incorreta: CNNs são para dados com estrutura espacial (imagens), não para imputação de valores ausentes em dados tabulares. PCA é para redução de dimensionalidade, não para normalização (escalonamento), e regressão logística é um modelo de classificação, não uma técnica de redução de dimensionalidade.
- B) Incorreta: CNNs não são usadas para escalonar dados tabulares. O algoritmo k-means é para clusterização (agrupamento), não para identificar a importância de variáveis para um modelo supervisionado.
- (C) Correta: Preencher valores ausentes com a média ou mediana é uma técnica comum e eficaz de imputação. Standard Scaler é um método padrão para escalonar dados, transformando-os para ter média zero e desvio padrão um. A importância de features calculada por um modelo de árvore de decisão (como Random Forest ou Gradient Boosting) é um método robusto e amplamente utilizado para selecionar as variáveis mais relevantes para um modelo supervisionado.
- D) Incorreta: Remover todas as linhas com valores ausentes pode levar à perda excessiva de dados. SVD (Singular Value Decomposition) é uma técnica de redução de dimensionalidade, não de normalização (escalonamento). O algoritmo k-means é para clusterização, não para seleção de variáveis. Armadilha da banca: Esta alternativa usa termos técnicos conhecidos (SVD, k-means) que são associados a pré-processamento, mas os aplica de forma incorreta às tarefas específicas de normalização e seleção de variáveis para um modelo supervisionado.
- E) Incorreta: A Análise de Cluster Hierárquico (HCA) é um algoritmo de clusterização (não supervisionado), não sendo adequado para prever ou imputar valores ausentes. Embora a normalização z-score esteja correta (é o mesmo que Standard Scaler), calcular a importância de variáveis com uma rede neural profunda é uma abordagem mais complexa e menos direta do que métodos baseados em árvores para essa finalidade específica.
Fonte: FCC TRT15 2024 Analista Judiciário - Área Apoio Especializado - Especialidade Tecnologia da Informação (Caderno Tipo 001). Reproduzida para fins de estudo.