Questão nº 69
Questão de Ciência de Dados · FGV TCE-PA 2024 (nº 69)
Ao se utilizar bancos de dados reais no treinamento de métodos de aprendizado de máquina é normal se deparar com entradas que possuem um ou mais parâmetros (campos) ausentes.
Com relação às estratégias para lidar com dados ausentes, analise as afirmativas a seguir.
I. Só é possível realizar imputation quando o atributo (feature) ausente é numérico.
II. Ao utilizar o k-nearest neighbors (KNN) para fazer o imputation é uma boa estratégia primeiro fazer a normalização ou padronização dos dados.
III. Ao se trabalhar com bancos de dados com poucas amostras (itens), uma estratégia usualmente utilizada para lidar com as amostras) que possuem valores ausentes é a remoção.
Está correto o que se afirma em
- AI, apenas.
- BII, apenas. (alternativa correta)
- CIII, apenas.
- DI e II apenas.
- EI, II e III.
Resposta comentada
Gabarito Alternativa B
Imputação é o processo de preencher valores ausentes em um conjunto de dados com valores substitutos, enquanto dados ausentes são informações que não foram coletadas ou estão indisponíveis em certas entradas.
(A) Incorreta: A imputação não se limita apenas a atributos numéricos. É possível imputar valores em atributos categóricos usando métodos como a moda (valor mais frequente), KNN para dados categóricos (encontrando o vizinho mais próximo e usando sua categoria), ou até mesmo criando uma nova categoria para "Ausente".
(B) Correta: O algoritmo KNN (k-vizinhos mais próximos) calcula distâncias entre os pontos de dados para encontrar os vizinhos mais próximos. Se as features (atributos) estiverem em escalas muito diferentes (por exemplo, uma feature de 0 a 10 e outra de 0 a 1000), a feature de maior escala dominará o cálculo da distância. Normalização ou padronização (escalonamento) dos dados garante que todas as features contribuam igualmente para a distância, melhorando a precisão da imputação baseada em KNN.
(C) Incorreta: Quando se trabalha com bancos de dados com poucas amostras, a remoção de linhas ou colunas que contêm valores ausentes (conhecida como "listwise deletion" ou "completa de casos") é geralmente uma estratégia ruim. Isso porque a remoção de amostras já escassas pode levar a uma perda significativa de informações, reduzir o poder estatístico do modelo e introduzir viés, tornando o modelo menos robusto e generalizável. A remoção é mais aceitável quando há muitas amostras e uma pequena porcentagem de dados ausentes.
Fonte: FGV TCE-PA 2024 Auditor de Controle Externo - Administrativa - Ciência de Dados (Caderno Tipo 1). Reproduzida para fins de estudo.