Questão nº 70

Questão de Tecnologia da Informação · FGV SMF-RJ 2023 - Manhã (P1) (nº 70)

FGV2023Fiscal de RendasTecnologia da Informação
Gabarito: Dver comentário ↓

Observe a seguinte estrutura do conjunto de dados PESSOA que contém dados sobre pessoas e a sua renda anual.

Figura da questão de Tecnologia da Informação

O conjunto de dados PESSOA será usado para a tarefa de aprendizagem supervisionada de classificação com a finalidade de prever se a renda (Classe) de uma pessoa excede 50 mil por ano.

Para isso, a operação de pré-processamento de dados que deve ser executada no conjunto de dados PESSOA é:

Resposta comentada

Gabarito Alternativa D

A normalização (ou escalonamento) de variáveis contínuas é um passo fundamental no pré-processamento de dados para muitos algoritmos de aprendizado de máquina, garantindo que todas as características numéricas tenham uma escala semelhante e evitando que características com valores maiores dominem o modelo.

  • (A) Incorreta: A coluna "Classe" é a variável alvo (o que se quer prever) e nunca deve ser excluída para a tarefa de classificação. Além disso, o conceito de outlier é geralmente aplicado a dados numéricos contínuos, não a variáveis categóricas como "Classe".
  • (B) Incorreta: Discretização é o processo de transformar variáveis contínuas em categorias. As colunas "Sexo", "Raça / Etnia" e "Educação" já são do tipo categórica, portanto, não faz sentido discretizá-las. Elas precisariam de codificação (e.g., One-Hot Encoding) para serem usadas por algoritmos de ML.
  • (C) Incorreta: Normalização por padronização (Standard Scaling) é uma técnica aplicada a variáveis numéricas contínuas. As colunas "Ocupação" e "Classe_trabalho" são do tipo categórica e não devem ser padronizadas. Elas também precisariam de codificação.
  • (D) Correta: As colunas "Idade, Ganho_capital, Anos_estudo e Horas_trabalhadas" são todas do tipo contínua. A normalização (que pode incluir padronização ou Min-Max Scaling) é uma operação essencial para essas variáveis em tarefas de aprendizado de máquina, pois ajuda a melhorar o desempenho e a convergência de muitos algoritmos, especialmente aqueles sensíveis à escala das características.
  • (E) Incorreta: Imputação de valores faltantes é importante, mas a média é usada para variáveis numéricas contínuas. Para a coluna "Sexo", que é categórica, a imputação de valores faltantes deve ser feita com a moda (valor mais frequente) ou criando uma nova categoria para "desconhecido", e não com a média. Armadilha: A banca tenta confundir o aluno com a técnica de imputação e a aplicação incorreta da média para uma variável categórica.

Fonte: FGV SMF-RJ 2023 - Manhã (P1) Fiscal de Rendas (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho