Questão nº 63

Questão de Fluência em Dados · FGV Receita Federal do Brasil 2023 - Manhã (nº 63)

FGV2023Analista-Tributário da Receita Federal do BrasilFluência em Dados
Gabarito: Aver comentário ↓

Assinale a opção que melhor descreve a diferença entre os frameworks Apache Spark e Apache Hadoop, no contexto do processamento de Big Data.

Resposta comentada

Gabarito Alternativa A

Apache Hadoop é um sistema que permite armazenar e processar grandes volumes de dados em clusters de computadores, usando principalmente o MapReduce para processamento em disco. Apache Spark é um motor de processamento de dados que pode rodar sobre o Hadoop (ou outros sistemas de armazenamento), mas que processa os dados em memória, tornando-o muito mais rápido.

(A) Correta: O Spark processa dados em memória usando RDDs (Resilient Distributed Datasets), o que elimina a necessidade de ler e gravar no disco a cada etapa, tornando-o significativamente mais rápido que o Hadoop, que tradicionalmente usa MapReduce com operações intensivas de leitura/escrita em disco.
(B) Incorreta: O Hadoop não é inerentemente mais rápido que o Spark; na verdade, o Spark é geralmente mais rápido. Ambos são escaláveis, e o Spark pode operar em clusters tão grandes quanto o Hadoop, aproveitando a memória para performance superior.
(C) Incorreta: O Spark é extremamente versátil e adequado para cargas de trabalho pesadas e complexas, incluindo machine learning e processamento de grafos, além de ser bom para interatividade. O Hadoop MapReduce é mais adequado para processamento em lote de longa duração, não para cargas de trabalho leves e interativas.
(D) Incorreta: Eles não utilizam as mesmas técnicas de processamento de dados. A principal diferença é justamente o modelo de processamento: Spark em memória vs. Hadoop MapReduce em disco. Embora o Spark seja ótimo para baixa latência e o Hadoop para lote, a premissa inicial da alternativa está errada. Armadilha da banca: Esta alternativa tenta confundir ao apresentar corretamente os casos de uso (Spark para baixa latência e Hadoop para lote) mas erra fundamentalmente ao afirmar que usam as mesmas técnicas de processamento.
(E) Incorreta: O Hadoop é uma tecnologia mais antiga que o Spark. O Spark foi criado justamente para superar as limitações de desempenho do MapReduce do Hadoop, oferecendo melhorias significativas em velocidade e flexibilidade.

Fonte: FGV Receita Federal do Brasil 2023 - Manhã Analista-Tributário da Receita Federal do Brasil (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho