Questão nº 70
Questão de Tecnologia da Informação · FGV SMF-RJ 2023 - Manhã (P1) (nº 70)
Observe a seguinte estrutura do conjunto de dados PESSOA que contém dados sobre pessoas e a sua renda anual.

O conjunto de dados PESSOA será usado para a tarefa de aprendizagem supervisionada de classificação com a finalidade de prever se a renda (Classe) de uma pessoa excede 50 mil por ano.
Para isso, a operação de pré-processamento de dados que deve ser executada no conjunto de dados PESSOA é:
- Aexclusão da coluna do tipo categórica "Classe" que possui outlier;
- Bdiscretização das colunas do tipo categórica "Sexo, Raça / Etnia e Educação";
- Cnormalização por padronização das colunas do tipo categórica "Ocupação e Classe_trabalho";
- Dnormalização das colunas do tipo contínua "Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas"; (alternativa correta)
- Eimputação de valores com base na média dos valores existentes na coluna do tipo categórica "Sexo" que possui valores faltantes.
Resposta comentada
Gabarito Alternativa D
A normalização (ou escalonamento) de variáveis contínuas é um passo fundamental no pré-processamento de dados para muitos algoritmos de aprendizado de máquina, garantindo que todas as características numéricas tenham uma escala semelhante e evitando que características com valores maiores dominem o modelo.
- (A) Incorreta: A coluna "Classe" é a variável alvo (o que se quer prever) e nunca deve ser excluída para a tarefa de classificação. Além disso, o conceito de outlier é geralmente aplicado a dados numéricos contínuos, não a variáveis categóricas como "Classe".
- (B) Incorreta: Discretização é o processo de transformar variáveis contínuas em categorias. As colunas "Sexo", "Raça / Etnia" e "Educação" já são do tipo categórica, portanto, não faz sentido discretizá-las. Elas precisariam de codificação (e.g., One-Hot Encoding) para serem usadas por algoritmos de ML.
- (C) Incorreta: Normalização por padronização (Standard Scaling) é uma técnica aplicada a variáveis numéricas contínuas. As colunas "Ocupação" e "Classe_trabalho" são do tipo categórica e não devem ser padronizadas. Elas também precisariam de codificação.
- (D) Correta: As colunas "Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas" são todas do tipo contínua. A normalização (que pode incluir padronização ou Min-Max Scaling) é uma operação essencial para essas variáveis em tarefas de aprendizado de máquina, pois ajuda a melhorar o desempenho e a convergência de muitos algoritmos, especialmente aqueles sensíveis à escala das características.
- (E) Incorreta: Imputação de valores faltantes é importante, mas a média é usada para variáveis numéricas contínuas. Para a coluna "Sexo", que é categórica, a imputação de valores faltantes deve ser feita com a moda (valor mais frequente) ou criando uma nova categoria para "desconhecido", e não com a média. Armadilha: A banca tenta confundir o aluno com a técnica de imputação e a aplicação incorreta da média para uma variável categórica.
Fonte: FGV SMF-RJ 2023 - Manhã (P1) Fiscal de Rendas (Caderno Tipo 1). Reproduzida para fins de estudo.