Questão nº 70
Questão de Tecnologia da Informação · CEBRASPE SEFAZ-RN 2025 - P2 Conhecimentos Complementares (nº 70)
No contexto de arquiteturas modernas para o ecossistema de Big Data, a organização funcional visa gerenciar o ciclo de vida do dado sob os pilares de volume, velocidade e variedade. Considerando as camadas funcionais e os princípios de processamento distribuído, assinale a opção correta.
- AO processamento de dados pode ser viabilizado por modelos de computação distribuída, permitindo a execução de cargas de trabalho tanto em lotes (batch) quanto em fluxos contínuos (streaming), visando à conversão de dados brutos em informações estruturadas ou semiestruturadas para consumo posterior. (alternativa correta)
- BEm arquiteturas de Big Data, o paradigma predominante é o schema-on-write, que exige que todos os dados (mesmo os não estruturados) sejam validados e tipados rigidamente antes de serem persistidos no sistema de armazenamento.
- CA camada de consumo ou visualização é opcional, dado que a extração de valor e o suporte à decisão ocorrem de forma automática e intrínseca durante o processo de transporte de dados entre os nós do cluster.
- DA camada de persistência em Big Data fundamenta-se obrigatoriamente em sistemas relacionais com propriedades ACID, visando garantir a integridade referencial estrita em todas as etapas do pipeline.
- EA camada de ingestão limita-se à coleta de dados em repouso via processos puramente batch, sendo tecnicamente incapaz de capturar fluxos de dados contínuos originados de sensores ou logs.
Resposta comentada
Gabarito Alternativa A
O conceito-chave é que Big Data não é uma ferramenta única, mas um ecossistema de camadas (ingestão, processamento, armazenamento, consumo) que trabalham juntas para lidar com dados em grande escala. A arquitetura moderna usa processamento distribuído (dividir o trabalho entre várias máquinas) para lidar com dados em batch (lotes, processados de uma vez) e streaming (fluxo contínuo, processados em tempo real), transformando dados brutos em algo útil.
- (A) Correta: É exatamente isso: a computação distribuída (ex: Hadoop, Spark) permite processar tanto lotes quanto fluxos contínuos, convertendo dados brutos em formatos estruturados ou semiestruturados para análise posterior.
- (B) Incorreta: A pegadinha está em "schema-on-write" (exigir validação rígida antes de salvar). O paradigma dominante em Big Data é o schema-on-read (interpretar os dados apenas na leitura), pois isso permite armazenar dados não estruturados sem pré-processamento, ganhando velocidade e flexibilidade.
- (C) Incorreta: A camada de consumo/visualização é essencial, pois é onde o usuário final extrai valor e toma decisões. O transporte de dados entre nós apenas move bytes, não gera insight automaticamente.
- (D) Incorreta: A persistência em Big Data usa bancos NoSQL (colunares, documentos, grafos) e sistemas distribuídos que priorizam escalabilidade horizontal e disponibilidade, muitas vezes relaxando ACID (teorema CAP) em favor de consistência eventual.
- (E) Incorreta: A camada de ingestão é dual: captura tanto dados em repouso (batch, via ETL) quanto dados em movimento (streaming, via Kafka, Flume), sendo perfeitamente capaz de processar fluxos contínuos de sensores e logs.
Fonte: CEBRASPE SEFAZ-RN 2025 - P2 Conhecimentos Complementares Auditor Fiscal de Receitas Estaduais. Reproduzida para fins de estudo.