Questão nº 75
Questão de Engenharia de Dados · FCC PMSP Analista TIC 2025 (nº 75)
A prefeitura de uma grande cidade deseja processar dados provenientes de sensores instalados no trânsito urbano, coletados em tempo real, para identificar padrões de congestionamento e propor soluções automatizadas. Nesse caso, o componente específico do Apache Spark que o torna adequado para realizar esta tarefa é o
- AMapReduce, que processa dados de forma distribuída, sendo ideal para o processamento em batch de grandes volumes de dados em tempo real.
- Bframework Spark SQL, que é usado para configurar bancos de dados relacionais em tempo real, otimizando o armazenamento dos dados do trânsito.
- Cmódulo spark MLlib, que é utilizado para a coleta e processamento de dados de sensores em tempo real.
- DHadoop Distributed File System (HDFS), que permite o processamento em tempo real de dados em fluxo, utilizando clusters locais para garantir baixa latência.
- Emódulo Spark Streaming, que permite o processamento em tempo real de dados em fluxo, utilizando micro-batches para garantir baixa latência. (alternativa correta)
Resposta comentada
Gabarito Alternativa E
Apache Spark é uma plataforma de processamento de dados que lida com grandes volumes de informações de forma rápida e distribuída. Para dados que chegam continuamente, como os de sensores de trânsito, precisamos de um componente que processe esses fluxos em tempo real.
(A) Incorreta: MapReduce é uma tecnologia mais antiga, focada em processamento em batch (lotes), não em tempo real, e o Spark é uma evolução que oferece mais funcionalidades.
(B) Incorreta: O Spark SQL é para processar dados estruturados usando consultas SQL, não para configurar bancos de dados relacionais ou otimizar armazenamento de dados brutos de sensores.
(C) Incorreta: O módulo Spark MLlib é para algoritmos de Machine Learning (aprendizado de máquina), não para a coleta ou o processamento inicial de dados de sensores em tempo real.
(D) Incorreta: O Hadoop Distributed File System (HDFS) é um sistema de armazenamento de arquivos distribuído, não um motor de processamento de dados em fluxo em tempo real.
(E) Correta: O módulo Spark Streaming é projetado especificamente para processar dados que chegam continuamente (em fluxo) em tempo real, dividindo-os em pequenos lotes (micro-batches) para garantir baixa latência.
Fonte: FCC PMSP Analista TIC 2025 Analista de Planejamento e Desenvolvimento Organizacional - Tecnologia da Informação e Comunicação (Caderno Tipo 001). Reproduzida para fins de estudo.