Questão nº 11
Questão de Ciência de Dados · FGV SEFAZ-MG 2022 - Tarde (nº 11)
Considere a consulta de streaming que conta os cliques dos usuários por país para uma campanha publicitária na web a cada 30 minutos. Ao aplicar o modelo de processamento de micro batch a esta consulta, o fluxo de dados é dividido em duas fases: batching e processing, como mostra a figura a seguir.

O processamento stream é obtido repetindo as fases de batching e processing para as novas tuplas de dados.
Em relação ao processamento stream em micro-batches, assinale a opção incorreta.
- AAs fases de batching e processing não são sobrepostas para quaisquer dois batches consecutivos. (alternativa correta)
- BNa fase batching, as tuplas de dados de fluxo são acumuladas por um intervalo de lote predeterminado. Em seguida, o conteúdo do lote é particionado e emitido na forma de blocos de dados para processamento paralelo.
- CNa fase processing, a consulta é executada na memória como um pipeline dos estágios map e reduce.
- DNo estágio map, uma função definida pelo usuário é aplicada em paralelo a cada bloco de dados (por exemplo, um filtro sobre as tuplas clickstream).
- EO estágio reduce agrega o resultado do estágio map para produzir a saída batch (por exemplo, soma os cliques para cada país).
Resposta comentada
Gabarito Alternativa A
O processamento em micro-batches é uma forma de lidar com dados em tempo real, onde um fluxo contínuo de informações é dividido em pequenos blocos (chamados micro-batches) que são processados um de cada vez, como se fossem pequenos lotes de dados.
- (A) Correta: Em sistemas de micro-batches eficientes, as fases de batching (coleta de dados para o próximo lote) e processing (processamento do lote atual) são frequentemente sobrepostas para otimizar o uso de recursos e manter o fluxo contínuo. A afirmação de que "não são sobrepostas" é falsa, tornando esta a opção incorreta a ser assinalada, conforme pedido na questão.
- (B) Incorreta: Esta afirmação descreve corretamente a fase de batching, onde os dados são acumulados por um intervalo fixo e depois divididos para processamento paralelo.
- (C) Incorreta: Esta afirmação descreve corretamente a fase de processing, onde a consulta é executada na memória para agilidade, muitas vezes usando um pipeline de operações como map e reduce.
- (D) Incorreta: Esta afirmação descreve corretamente o estágio map, que aplica uma função personalizada em paralelo a cada parte dos dados, como filtrar cliques.
- (E) Incorreta: Esta afirmação descreve corretamente o estágio reduce, que agrega os resultados do map para gerar a saída final do lote, como a soma de cliques por país.
Fonte: FGV SEFAZ-MG 2022 - Tarde Auditor Fiscal - Tecnologia da Informação (Caderno Tipo 1). Reproduzida para fins de estudo.