Questão nº 70
Questão de Tecnologia da Informação · FGV DATAPREV 2024 (nº 70)
Uma empresa multinacional está desenvolvendo uma plataforma avançada de Business Intelligence (BI) para integrar e analisar dados provenientes de diversas unidades de negócio ao redor do mundo. As fontes de dados incluem:
Sistemas transacionais estruturados: bancos de dados relacionais de ERP e CRM que armazenam informações sobre vendas, clientes e operações internas.
Dados semiestruturados: arquivos XML e JSON contendo registros de transações online e interações de usuários em aplicativos móveis.
Dados não estruturados: logs de servidores web, postagens em redes sociais, emails de suporte ao cliente dados de sensores IoT.
A empresa planeja implementar um Data Warehouse com um modelo multidimensional otimizado para permitir análises complexas e operações de OLAP que suportem a tomada de decisões estratégicas.
Durante o projeto, a equipe enfrenta os seguintes desafios:
Integração de dados heterogêneos: unificar dados estruturados, semiestruturados e não estruturados em um ambiente coeso.
Modelagem e otimização: desenvolver um modelo multidimensional que atenda às necessidades analíticas complexas, mantendo o desempenho.
Definição de hierarquias e granularidades: estabelecer níveis adequados de detalhe para suportar operações de OLAP como drill-down e roll-up.
Com base nesse cenário, avalie as afirmativas a seguir:
I. Para mapear as fontes de dados heterogêneas, é essencial utilizar metadados padronizados que descrevam a estrutura, o significado e a qualidade dos dados, facilitando sua integração no Data Warehouse.
II. Na modelagem multidimensional, a adoção de um esquema em floco de neve (snowflake schema), com tabelas de dimensões normalizadas, melhora o desempenho das consultas OLAP em comparação com o esquema estrela (star schema).
III. As operações de OLAP permitem análises em múltiplas dimensões; por exemplo, o slice fixa um valor em uma dimensão, enquanto o dice cria um subcubo selecionando valores específicos em múltiplas dimensões.
IV. A implementação de uma política de governança de dados clara e abrangente é fundamental para garantir a qualidade, consistência, segurança e privacidade dos dados ao longo de todo o ciclo de vida do projeto de BI.
Está correto o que se afirma em
- AI, II, apenas.
- BI, III, apenas.
- CII e III, apenas.
- DII, III e IV, apenas.
- EIII e IV, apenas. (alternativa correta)
Resposta comentada
Gabarito Alternativa E
Business Intelligence (BI) é um conjunto de processos e tecnologias que ajudam empresas a coletar, analisar e apresentar dados para tomar decisões mais inteligentes. A Modelagem Dimensional é uma técnica para organizar esses dados em um Data Warehouse (um grande repositório de dados) de forma que sejam fáceis de consultar e analisar, usando tabelas de fatos (o que medimos) e tabelas de dimensões (como medimos).
- (I) Incorreta: Embora o uso de metadados (dados sobre dados) seja fundamental para entender e gerenciar fontes de dados heterogêneas, a afirmação de que eles devem ser "padronizados" antes da integração pode ser um ponto de discórdia. Muitas vezes, a padronização dos metadados é um objetivo ou um resultado do processo de integração e transformação dos dados no Data Warehouse, e não um pré-requisito universal para o mapeamento inicial de fontes que, por natureza, são diversas e não padronizadas.
- (II) Incorreta: Esta é uma armadilha comum. O esquema em floco de neve (snowflake schema), por ter dimensões normalizadas (divididas em sub-tabelas), geralmente exige mais joins (uniões de tabelas) para recuperar os dados completos de uma dimensão. Isso, na maioria dos casos, diminui o desempenho das consultas OLAP em comparação com o esquema estrela (star schema), que usa dimensões desnormalizadas (tabelas únicas para cada dimensão), otimizando a velocidade das consultas ao custo de alguma redundância de dados e maior uso de espaço. O esquema estrela é preferido para desempenho em OLAP.
- (III) Correta: As operações de OLAP são essenciais para a análise multidimensional. O slice (fatiar) realmente seleciona um único valor em uma dimensão, criando uma "fatia" bidimensional do cubo de dados (por exemplo, vendas de um produto específico). O dice (dado) seleciona múltiplos valores em múltiplas dimensões, criando um "subcubo" menor (por exemplo, vendas de produtos A e B, nas regiões X e Y, no mês de janeiro).
- (IV) Correta: A governança de dados é um pilar crucial em qualquer projeto de BI, especialmente em uma multinacional com dados heterogêneos. Ela estabelece as políticas e processos para garantir que os dados sejam de alta qualidade (precisos, completos), consistentes (uniformes entre as fontes), seguros (protegidos contra acesso não autorizado) e privados (em conformidade com regulamentações), o que é vital para a confiabilidade das análises e decisões estratégicas.
Fonte: FGV DATAPREV 2024 Analista de Tecnologia da Informação - Análise de Negócio de TI (Caderno Tipo 1). Reproduzida para fins de estudo.