Questão nº 49
Questão de Análise de Informação · FGV CGE-SC 2022 (nº 49)
Sobre a divisão e o tratamento de dados, assinale a afirmativa correta.
- AOs dados coletados podem ser de três tipos: numéricos, texto e imagem; assim, os algoritmos de aprendizagem de máquina são capazes de lidar com todos os tipos de dados, bastando que os dados sejam transformados para dados contínuos utilizando técnicas como interpolação.
- BMédia da coluna, interpolação de vizinhos mais próximos, moda da coluna, vizinhos mais próximos (KNN) e valor aleatório são métodos para tratamento de dados faltantes, ou seja, atributos não preenchidos na base de dados. (alternativa correta)
- CValidação cruzada é um método de divisão dos dados em que os dados são divididos por k partes em que, a cada rodada, uma das partes é o conjunto de teste e o restante é utilizado para treino; a divisão dos conjuntos estratificada para validação cruzada não é aconselhada caso o valor de k seja igual a 10.
- DO método de divisão de dados leave-one-out (deixando um de fora) aproveita o máximo dos dados, pois todos os dados, com exceção de um item, são utilizados para treinar a cada execução; essa configuração é a mais utilizada para algoritmos custosos de aprendizado de máquina como as redes neurais profundas.
- EA divisão dos dados em 3 conjuntos (treino, validação e teste) é bastante comum para avaliação de algoritmos com muitos parâmetros, como as redes neurais; o conjunto de validação funciona como um conjunto de avaliação de parâmetros e é utilizado para confirmar se o algoritmo encontrou o máximo global.
Resposta comentada
Gabarito Alternativa B
Em mineração de dados, a preparação dos dados é crucial e envolve tanto o tratamento de informações ausentes quanto a divisão estratégica dos dados para treinar e avaliar o desempenho de um modelo de forma justa.
(A) Incorreta: Embora existam tipos de dados como numéricos, texto e imagem, e algoritmos de ML possam lidar com eles após pré-processamento, a afirmação de que "basta transformar para dados contínuos utilizando interpolação" é falsa. Dados de texto e imagem exigem técnicas complexas de extração de características (ex: embeddings, redes neurais convolucionais) e não uma simples interpolação para se tornarem "contínuos" e serem processados por qualquer algoritmo.
(B) Correta: Média da coluna (para numéricos), moda da coluna (para categóricos), interpolação (para séries temporais ou dados ordenados), KNN (baseado em vizinhos similares) e valor aleatório são, de fato, métodos comuns e válidos para preencher ou "imputar" dados faltantes (atributos não preenchidos) em um conjunto de dados.
(C) Incorreta: A validação cruzada estratificada é altamente recomendada, especialmente para garantir que a proporção das classes seja mantida em cada "dobra" (parte), o que é crucial para evitar vieses, principalmente em conjuntos de dados desbalanceados. O valor de k=10 é um dos mais utilizados e geralmente aconselhados na validação cruzada, não o contrário. A armadilha está em afirmar que a estratificação "não é aconselhada" para k=10, quando na verdade é uma boa prática.
(D) Incorreta: O método leave-one-out (LOOCV) realmente aproveita ao máximo os dados para treino, mas ele exige que o modelo seja treinado N vezes (onde N é o número de amostras), tornando-o computacionalmente proibitivo para algoritmos "custosos" como as redes neurais profundas. Portanto, não é a configuração mais utilizada para esses algoritmos. A armadilha é sugerir que é ideal para algoritmos caros, quando na verdade é o oposto.
(E) Incorreta: A divisão em treino, validação e teste é comum, e o conjunto de validação é usado para ajustar hiperparâmetros e evitar overfitting (quando o modelo se "decora" os dados de treino e não generaliza bem). No entanto, ele não é usado para "confirmar se o algoritmo encontrou o máximo global". Encontrar o máximo (ou mínimo) global em redes neurais complexas é muitas vezes intratável, e o objetivo do conjunto de validação é selecionar um modelo que generalize bem, não garantir a otimalidade global da função de perda.
Fonte: FGV CGE-SC 2022 Auditor do Estado - Ciências da Computação (Caderno Tipo 1). Reproduzida para fins de estudo.