Questão nº 43

Questão de Ciência de Dados · FGV CGU 2021 - Tarde (nº 43)

FGV2021Auditor Federal de Finanças e Controle - Área Tecnologia da InformaçãoCiência de Dados
Gabarito: Cver comentário ↓

Uma organização deseja implementar um pipeline de dados e está avaliando a opção mais adequada para o seu contexto de operação. Em torno de 40% dos dados consumidos pela organização se encontram em planilhas eletrônicas que contêm dados sensíveis, produzidas semanalmente por suas unidades de negócio. Os outros 60% dos dados se encontram em alguns bancos de dados relacionais de sistemas de produção da organização. O tamanho da base é de moderado a pequeno, mas existe a necessidade de conformidade com normas de privacidade e confidencialidade dos dados. O objetivo do pipeline é fornecer insumos para um departamento que realiza análises de dados com métodos não supervisionados de aprendizagem de máquina para elaborar relatórios periódicos mensais. A organização está avaliando a construção de um Armazém de Dados (ETL) ou de um Lago de Dados (ELT).

A proposta de modelo adequada e corretamente justificada é:

Resposta comentada

Gabarito Alternativa C

Conceito-chave: Data Warehouse (com ETL) é como uma cozinha que só recebe ingredientes já limpos, cortidos e padronizados antes de entrar. Data Lake (com ELT) é um depósito que guarda tudo cru, do jeito que veio, para limpar depois. Para dados sensíveis e relatórios previsíveis, a limpeza antes de armazenar (ETL) é mais segura e controlada.

  • (A) Incorreta: A afirmação sobre "maior latência" no Lago de Dados é invertida (ELT carrega cru e rápido), e o custo de um Data Warehouse não é necessariamente maior que um Data Lake em nuvem, dependendo do volume.
  • (B) Incorreta: A "menor latência até a carga" é característica do ELT (Lago), não do ETL (Armazém), que transforma antes de carregar. Além disso, o Armazém também opera bem com dados relacionais, mas esse não é o diferencial decisivo aqui.
  • (C) Correta: O ETL (Extrair, Transformar, Carregar) aplica regras de limpeza, anonimização e conformidade antes de os dados sensíveis chegarem ao destino final. Como os casos de uso (relatórios mensais com métodos não supervisionados) são bem definidos e o volume é pequeno/moderado, o Armazém de Dados é mais adequado para garantir privacidade e confidencialidade.
  • (D) Incorreta: A pegadinha está em "menor latência até a carga (L)": isso é verdade para ELT, mas o texto pede conformidade com dados sensíveis. Carregar tudo cru (ELT) aumenta o risco de exposição de dados pessoais antes do tratamento.
  • (E) Incorreta: A armadilha aqui é "possibilita tarefas de aprendizado de máquina". Embora o Data Lake seja ótimo para ML exploratório, o Armazém de Dados também suporta ML (como regressão e clusterização) com dados estruturados. A justificativa de "não necessitar de hardware especializado" é genérica e não resolve o problema central de privacidade.

Fonte: FGV CGU 2021 - Tarde Auditor Federal de Finanças e Controle - Área Tecnologia da Informação (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho