Questão nº 70
Questão de Tecnologia da Informação · FGV DATAPREV 2024 (nº 70)
Uma empresa multinacional está desenvolvendo uma plataforma avançada de Business Intelligence (BI) para integrar e analisar dados provenientes de diversas unidades de negócio ao redor do mundo. As fontes de dados incluem:
Sistemas transacionais estruturados: bancos de dados relacionais de ERP e CRM que armazenam informações sobre vendas, clientes e operações internas.
Dados semiestruturados: arquivos XML e JSON contendo registros de transações online e interações de usuários em aplicativos móveis.
Dados não estruturados: logs de servidores web, postagens em redes sociais, emails de suporte ao cliente dados de sensores IoT.
A empresa planeja implementar um Data Warehouse com um modelo multidimensional otimizado para permitir análises complexas e operações de OLAP que suportem a tomada de decisões estratégicas.
Durante o projeto, a equipe enfrenta os seguintes desafios:
Integração de dados heterogêneos: unificar dados estruturados, semiestruturados e não estruturados em um ambiente coeso.
Modelagem e otimização: desenvolver um modelo multidimensional que atenda às necessidades analíticas complexas, mantendo o desempenho.
Definição de hierarquias e granularidades: estabelecer níveis adequados de detalhe para suportar operações de OLAP como drill-down e roll-up.
Com base nesse cenário, avalie as afirmativas a seguir:
I. Para mapear as fontes de dados heterogêneas, é essencial utilizar metadados padronizados que descrevam a estrutura, o significado e a qualidade dos dados, facilitando sua integração no Data Warehouse.
II. Na modelagem multidimensional, a adoção de um esquema em floco de neve (snowflake schema), com tabelas de dimensões normalizadas, melhora o desempenho das consultas OLAP em comparação com o esquema estrela (star schema).
III. As operações de OLAP permitem análises em múltiplas dimensões; por exemplo, o slice fixa um valor em uma dimensão, enquanto o dice cria um subcubo selecionando valores específicos em múltiplas dimensões.
IV. A implementação de uma política de governança de dados clara e abrangente é fundamental para garantir a qualidade, consistência, segurança e privacidade dos dados ao longo de todo o ciclo de vida do projeto de BI.
Está correto o que se afirma em
- AI, II, apenas.
- BI, III, apenas.
- CII e III, apenas.
- DII, III e IV, apenas.
- EIII e IV, apenas. (alternativa correta)
Resposta comentada
Gabarito Alternativa E
Conceito-chave: Em modelagem dimensional, o esquema estrela (tabelas de dimensões desnormalizadas) é geralmente mais rápido para consultas OLAP do que o esquema floco de neve (dimensões normalizadas), pois exige menos joins. Além disso, a banca cobra a definição precisa das operações OLAP: slice (fatia) e dice (dado) têm significados específicos.
- (A) Incorreta: A afirmativa I é verdadeira (metadados padronizados são essenciais para integrar fontes heterogêneas), mas a II é falsa, pois o snowflake schema piora o desempenho de consultas OLAP em comparação ao star schema, devido ao maior número de joins entre tabelas normalizadas.
- (B) Incorreta: A afirmativa I é verdadeira, mas a III também é verdadeira (slice fixa um valor em uma dimensão; dice seleciona valores em múltiplas dimensões, criando um subcubo). Como a II é falsa, a combinação I e III não pode ser a resposta correta, pois a questão pede a alternativa que contenha todas as afirmações verdadeiras e apenas elas.
- (C) Incorreta: A afirmativa II é falsa (o snowflake não melhora o desempenho, ele o degrada). Embora a III seja verdadeira, a presença da II invalida esta alternativa.
- (D) Incorreta: A afirmativa II é falsa (o snowflake não melhora o desempenho, ele o degrada). Embora III e IV sejam verdadeiras, a presença da II invalida esta alternativa.
- (E) Correta: As afirmativas III e IV são verdadeiras. III define corretamente as operações OLAP slice (fixa um valor em uma dimensão) e dice (seleciona valores em múltiplas dimensões, criando um subcubo). IV está correta, pois a governança de dados garante qualidade, consistência, segurança e privacidade ao longo de todo o ciclo de vida do BI. A afirmativa II é a pegadinha: a banca tenta fazer você acreditar que normalizar dimensões (snowflake) melhora o desempenho, mas o oposto é verdadeiro — o star schema é mais rápido por exigir menos joins.
Fonte: FGV DATAPREV 2024 Analista de Tecnologia da Informação - Análise de Negócio de TI (Caderno Tipo 1). Reproduzida para fins de estudo.