Questão nº 76
Questão de Ciência de Dados · FGV TCE-PA 2024 (nº 76)
Sobre o processo de ingestão de dados, avalie se as afirmativas a seguir são verdadeiras (V) ou falsas (F).
( ) Dados não estruturados podem incluir arquivos de texto, logs e outras formas de informação não padronizada.
( ) A ingestão de dados em lote pode ser iniciada mediante agendamento ou quando os dados atingem um limite de tamanho predeterminado.
( ) Apesar de ser mais simples de implementar, a ingestão de dados incremental ou diferencial é ideal para minimizar o tráfego na rede e o uso do storage.
( ) É mais comum adicionar etapas adicionais de transformação e limpeza dos dados em dados estruturados do que em não estruturados.
As afirmativas são, respetivamente,
- AF – V – V – F.
- BV – F – F – V.
- CV – F – V – F.
- DV – V – F – F. (alternativa correta)
- EF – V – F – V.
Resposta comentada
Gabarito Alternativa D
A ingestão de dados é o processo de mover dados de uma ou mais fontes para um sistema de destino onde podem ser armazenados, processados e analisados. É a primeira etapa em qualquer pipeline de dados, garantindo que a informação chegue ao seu destino de forma eficiente e confiável.
(A) Incorreta: A primeira afirmativa está correta, não incorreta.
(B) Incorreta: A segunda afirmativa está correta, não incorreta.
(C) Incorreta: A terceira afirmativa está incorreta, não correta.
(D) Correta:
- (V) Dados não estruturados podem incluir arquivos de texto, logs e outras formas de informação não padronizada. Verdadeiro. Dados não estruturados são aqueles que não possuem um modelo de dados predefinido ou uma estrutura organizacional rígida, como documentos de texto, e-mails, logs de servidores, imagens, áudios e vídeos.
- (V) A ingestão de dados em lote pode ser iniciada mediante agendamento ou quando os dados atingem um limite de tamanho predeterminado. Verdadeiro. A ingestão em lote (batch processing) é caracterizada por processar grandes volumes de dados de uma só vez, e esses "lotes" são comumente disparados por um horário fixo (agendamento) ou quando uma certa quantidade de dados se acumula.
- (F) Apesar de ser mais simples de implementar, a ingestão de dados incremental ou diferencial é ideal para minimizar o tráfego na rede e o uso do storage. Falso. A ingestão incremental ou diferencial é, de fato, ideal para minimizar o tráfego de rede e o uso de armazenamento, pois transfere apenas as mudanças desde a última ingestão. No entanto, ela é geralmente mais complexa de implementar do que uma ingestão de carga total (full load), pois exige mecanismos para identificar e rastrear essas mudanças (como timestamps, Change Data Capture - CDC, ou versionamento), o que adiciona complexidade ao design e à manutenção. Esta é a armadilha da banca: a primeira parte da frase ("mais simples de implementar") torna a afirmação falsa como um todo.
- (F) É mais comum adicionar etapas adicionais de transformação e limpeza dos dados em dados estruturados do que em não estruturados. Falso. O oposto é verdadeiro. Dados não estruturados (como texto livre, logs) exigem muito mais etapas de transformação e limpeza para extrair significado e convertê-los em um formato que possa ser analisado (por exemplo, extração de entidades de texto, parsing de logs em campos específicos). Dados estruturados já possuem um formato definido, embora ainda precisem de limpeza (tratamento de nulos, padronização) e transformação (agregações, junções), o esforço inicial para torná-los utilizáveis é geralmente menor do que para dados não estruturados.
(E) Incorreta: A primeira e a quarta afirmativas estão incorretas, não corretas.
Fonte: FGV TCE-PA 2024 Auditor de Controle Externo - Administrativa - Ciência de Dados (Caderno Tipo 1). Reproduzida para fins de estudo.