Questão nº 63
Questão de Fluência em Dados · FGV Receita Federal do Brasil 2023 - Manhã (nº 63)
Assinale a opção que melhor descreve a diferença entre os frameworks Apache Spark e Apache Hadoop, no contexto do processamento de Big Data.
- AO processamento de dados no Spark é mais rápido do que no Hadoop, pois ele é baseado em memória e utiliza RDDs, enquanto o Hadoop é baseado em disco e utiliza MapReduce. (alternativa correta)
- BO processamento de dados no Hadoop é mais rápido do que no Spark, pois o Hadoop é mais escalável e utiliza clusters maiores, enquanto o Spark é limitado pelo tamanho do cluster.
- CO Spark é mais adequado para cargas de trabalho mais pesadas, enquanto o Hadoop é melhor para cargas de trabalho mais leves e interativas.
- DO Spark e o Hadoop utilizam as mesmas técnicas de processamento de dados, mas o Spark é mais adequado para casos de uso em que a latência é um fator crítico, enquanto o Hadoop é mais adequado para casos de uso em que a capacidade de processamento em lote é mais importante.
- EO Hadoop é uma tecnologia mais recente que oferece melhorias, em relação ao Spark, em termos de desempenho e velocidade de processamento.
Resposta comentada
Gabarito Alternativa A
Apache Hadoop é um sistema que permite armazenar e processar grandes volumes de dados em clusters de computadores, usando principalmente o MapReduce para processamento em disco. Apache Spark é um motor de processamento de dados que pode rodar sobre o Hadoop (ou outros sistemas de armazenamento), mas que processa os dados em memória, tornando-o muito mais rápido.
(A) Correta: O Spark processa dados em memória usando RDDs (Resilient Distributed Datasets), o que elimina a necessidade de ler e gravar no disco a cada etapa, tornando-o significativamente mais rápido que o Hadoop, que tradicionalmente usa MapReduce com operações intensivas de leitura/escrita em disco.
(B) Incorreta: O Hadoop não é inerentemente mais rápido que o Spark; na verdade, o Spark é geralmente mais rápido. Ambos são escaláveis, e o Spark pode operar em clusters tão grandes quanto o Hadoop, aproveitando a memória para performance superior.
(C) Incorreta: O Spark é extremamente versátil e adequado para cargas de trabalho pesadas e complexas, incluindo machine learning e processamento de grafos, além de ser bom para interatividade. O Hadoop MapReduce é mais adequado para processamento em lote de longa duração, não para cargas de trabalho leves e interativas.
(D) Incorreta: Eles não utilizam as mesmas técnicas de processamento de dados. A principal diferença é justamente o modelo de processamento: Spark em memória vs. Hadoop MapReduce em disco. Embora o Spark seja ótimo para baixa latência e o Hadoop para lote, a premissa inicial da alternativa está errada. Armadilha da banca: Esta alternativa tenta confundir ao apresentar corretamente os casos de uso (Spark para baixa latência e Hadoop para lote) mas erra fundamentalmente ao afirmar que usam as mesmas técnicas de processamento.
(E) Incorreta: O Hadoop é uma tecnologia mais antiga que o Spark. O Spark foi criado justamente para superar as limitações de desempenho do MapReduce do Hadoop, oferecendo melhorias significativas em velocidade e flexibilidade.
Fonte: FGV Receita Federal do Brasil 2023 - Manhã Analista-Tributário da Receita Federal do Brasil (Caderno Tipo 1). Reproduzida para fins de estudo.