Questão nº 43
Questão de Ciência de Dados · FGV CGU 2021 - Tarde (nº 43)
Uma organização deseja implementar um pipeline de dados e está avaliando a opção mais adequada para o seu contexto de operação. Em torno de 40% dos dados consumidos pela organização se encontram em planilhas eletrônicas que contêm dados sensíveis, produzidas semanalmente por suas unidades de negócio. Os outros 60% dos dados se encontram em alguns bancos de dados relacionais de sistemas de produção da organização. O tamanho da base é de moderado a pequeno, mas existe a necessidade de conformidade com normas de privacidade e confidencialidade dos dados. O objetivo do pipeline é fornecer insumos para um departamento que realiza análises de dados com métodos não supervisionados de aprendizagem de máquina para elaborar relatórios periódicos mensais. A organização está avaliando a construção de um Armazém de Dados (ETL) ou de um Lago de Dados (ELT).
A proposta de modelo adequada e corretamente justificada é:
- AArmazém de Dados. Ambos os modelos são adequados, mas Lago de Dados tem maior latência até a carga (L) e custo maior;
- BArmazém de Dados. Esse modelo possui menor latência até a carga (L) e, ao contrário do Lago de Dados, opera de forma eficiente com dados relacionais;
- CArmazém de Dados. O processo ETL é mais adequado para o tratamento dos dados sensíveis e os casos de uso são bem conhecidos; (alternativa correta)
- DLago de Dados. Esse modelo possui menor latência até a carga (L) e permite a extração (E) de dados semiestruturados e não estruturados;
- ELago de Dados. Esse modelo não necessita de hardware especializado e, ao contrário do Armazém de Dados, possibilita tarefas de aprendizado de máquina.
Resposta comentada
Gabarito Alternativa C
Conceito-chave: Data Warehouse (com ETL) é como uma cozinha que só recebe ingredientes já limpos, cortidos e padronizados antes de entrar. Data Lake (com ELT) é um depósito que guarda tudo cru, do jeito que veio, para limpar depois. Para dados sensíveis e relatórios previsíveis, a limpeza antes de armazenar (ETL) é mais segura e controlada.
- (A) Incorreta: A afirmação sobre "maior latência" no Lago de Dados é invertida (ELT carrega cru e rápido), e o custo de um Data Warehouse não é necessariamente maior que um Data Lake em nuvem, dependendo do volume.
- (B) Incorreta: A "menor latência até a carga" é característica do ELT (Lago), não do ETL (Armazém), que transforma antes de carregar. Além disso, o Armazém também opera bem com dados relacionais, mas esse não é o diferencial decisivo aqui.
- (C) Correta: O ETL (Extrair, Transformar, Carregar) aplica regras de limpeza, anonimização e conformidade antes de os dados sensíveis chegarem ao destino final. Como os casos de uso (relatórios mensais com métodos não supervisionados) são bem definidos e o volume é pequeno/moderado, o Armazém de Dados é mais adequado para garantir privacidade e confidencialidade.
- (D) Incorreta: A pegadinha está em "menor latência até a carga (L)": isso é verdade para ELT, mas o texto pede conformidade com dados sensíveis. Carregar tudo cru (ELT) aumenta o risco de exposição de dados pessoais antes do tratamento.
- (E) Incorreta: A armadilha aqui é "possibilita tarefas de aprendizado de máquina". Embora o Data Lake seja ótimo para ML exploratório, o Armazém de Dados também suporta ML (como regressão e clusterização) com dados estruturados. A justificativa de "não necessitar de hardware especializado" é genérica e não resolve o problema central de privacidade.
Fonte: FGV CGU 2021 - Tarde Auditor Federal de Finanças e Controle - Área Tecnologia da Informação (Caderno Tipo 1). Reproduzida para fins de estudo.