Questão nº 49

Questão de Análise de Informação · FGV CGE-SC 2022 (nº 49)

FGV2022Auditor do Estado - Ciências da ComputaçãoAnálise de Informação
Gabarito: Bver comentário ↓

Sobre a divisão e o tratamento de dados, assinale a afirmativa correta.

Resposta comentada

Gabarito Alternativa B

Em mineração de dados, a preparação dos dados é crucial e envolve tanto o tratamento de informações ausentes quanto a divisão estratégica dos dados para treinar e avaliar o desempenho de um modelo de forma justa.

(A) Incorreta: Embora existam tipos de dados como numéricos, texto e imagem, e algoritmos de ML possam lidar com eles após pré-processamento, a afirmação de que "basta transformar para dados contínuos utilizando interpolação" é falsa. Dados de texto e imagem exigem técnicas complexas de extração de características (ex: embeddings, redes neurais convolucionais) e não uma simples interpolação para se tornarem "contínuos" e serem processados por qualquer algoritmo.
(B) Correta: Média da coluna (para numéricos), moda da coluna (para categóricos), interpolação (para séries temporais ou dados ordenados), KNN (baseado em vizinhos similares) e valor aleatório são, de fato, métodos comuns e válidos para preencher ou "imputar" dados faltantes (atributos não preenchidos) em um conjunto de dados.
(C) Incorreta: A validação cruzada estratificada é altamente recomendada, especialmente para garantir que a proporção das classes seja mantida em cada "dobra" (parte), o que é crucial para evitar vieses, principalmente em conjuntos de dados desbalanceados. O valor de k=10 é um dos mais utilizados e geralmente aconselhados na validação cruzada, não o contrário. A armadilha está em afirmar que a estratificação "não é aconselhada" para k=10, quando na verdade é uma boa prática.
(D) Incorreta: O método leave-one-out (LOOCV) realmente aproveita ao máximo os dados para treino, mas ele exige que o modelo seja treinado N vezes (onde N é o número de amostras), tornando-o computacionalmente proibitivo para algoritmos "custosos" como as redes neurais profundas. Portanto, não é a configuração mais utilizada para esses algoritmos. A armadilha é sugerir que é ideal para algoritmos caros, quando na verdade é o oposto.
(E) Incorreta: A divisão em treino, validação e teste é comum, e o conjunto de validação é usado para ajustar hiperparâmetros e evitar overfitting (quando o modelo se "decora" os dados de treino e não generaliza bem). No entanto, ele não é usado para "confirmar se o algoritmo encontrou o máximo global". Encontrar o máximo (ou mínimo) global em redes neurais complexas é muitas vezes intratável, e o objetivo do conjunto de validação é selecionar um modelo que generalize bem, não garantir a otimalidade global da função de perda.

Fonte: FGV CGE-SC 2022 Auditor do Estado - Ciências da Computação (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho