Questão nº 50
Questão de Gestão de TI · FCC PMSP Analista TIC 2025 (nº 50)
Uma Prefeitura Municipal está desenvolvendo uma solução de Big Data para gerenciar dados de mobilidade, saúde pública e planejamento urbano. O objetivo é processar grandes volumes de dados provenientes de diversas fontes, como sensores de tráfego, prontuários eletrônicos e imagens. Optando por integrar as tecnologias Hadoop e Spark, a equipe técnica decidiu
- Autilizar o HDFS do Hadoop para armazenamento distribuído dos grandes volumes de dados e o Spark Core para processar os dados em memória, integrando o Spark Streaming para transmissões em tempo real. (alternativa correta)
- Badotar o Hadoop Common para processamento em memória e o Spark Streaming para armazenamento distribuído, otimizando a integração entre os componentes.
- Cconfigurar o YARN do Hadoop como um sistema de armazenamento nativo para o Spark, utilizando o Spark SQL para processar os dados em tempo real.
- Dutilizar o MapReduce do Hadoop para processamento em lotes e o GraphX do Spark como sistema de arquivos para dados distribuídos, garantindo escalabilidade.
- Eimplementar o Mlib do Spark para armazenamento distribuído e o MapReduce do Hadoop para processamento em tempo real, aproveitando a capacidade paralela das tecnologias.
Resposta comentada
Gabarito Alternativa A
O Hadoop é um ecossistema para armazenar e processar grandes volumes de dados de forma distribuída, enquanto o Spark é um motor de processamento de dados rápido e versátil que pode operar sobre os dados armazenados no Hadoop, especialmente em memória.
(A) Correta: O HDFS (Hadoop Distributed File System) é o componente do Hadoop ideal para o armazenamento distribuído de grandes volumes de dados. O Spark Core é o motor principal do Spark, responsável pelo processamento de dados em memória, o que o torna muito rápido. O Spark Streaming é o módulo específico do Spark para processar dados em tempo real, como transmissões contínuas. Esta alternativa descreve uma arquitetura padrão e eficiente para integrar Hadoop e Spark, atendendo aos requisitos de armazenamento de grandes volumes e processamento em memória e em tempo real.
(B) Incorreta: O Hadoop Common são utilidades básicas do Hadoop, não um motor de processamento em memória. O Spark Streaming é para processamento em tempo real, não para armazenamento distribuído.
(C) Incorreta: O YARN do Hadoop é um gerenciador de recursos, não um sistema de armazenamento. O Spark SQL é para dados estruturados e consultas SQL, não sendo o módulo principal para processamento em tempo real (essa função é do Spark Streaming).
(D) Incorreta: O MapReduce do Hadoop é para processamento em lotes, mas o GraphX do Spark é uma biblioteca para processamento de grafos, não um sistema de arquivos para dados distribuídos. A armadilha aqui é confundir "processamento distribuído de grafos" com "armazenamento distribuído de arquivos".
(E) Incorreta: O MLlib do Spark é uma biblioteca de Machine Learning, não um sistema de armazenamento distribuído. O MapReduce do Hadoop é para processamento em lotes, não em tempo real.
Fonte: FCC PMSP Analista TIC 2025 Analista de Planejamento e Desenvolvimento Organizacional - Tecnologia da Informação e Comunicação (Caderno Tipo 001). Reproduzida para fins de estudo.