Questão nº 62
Questão de Tecnologia da Informação · CESGRANRIO BB 01/2022 (nº 62)
Um profissional de TI está trabalhando com um grande banco de dados (Big Data), realizando uma análise prévia da base de dados, com o objetivo de identificar anomalias ou resultados raros, de forma a tratá-los ou descartá-los para utilização.
Esse profissional está realizando a seguinte tarefa:
- AAgrupamento dos dados
- BAnálise de associações dos dados
- CAnálise de segmentação dos dados
- DAnálise de outliers (pontos fora da curva) ou detecção de desvios (alternativa correta)
- EClassificação dos dados e das anomalias
Resposta comentada
Gabarito Alternativa D
Conceito-chave: Em Big Data, antes de qualquer análise, você precisa limpar os dados. A tarefa de procurar valores que fogem totalmente do padrão (muito altos, muito baixos, ou completamente diferentes do resto) é chamada de detecção de outliers (pontos fora da curva) ou detecção de desvios. O objetivo é encontrar essas anomalias para decidir se elas são erros (e devem ser descartadas) ou eventos raros (que precisam de tratamento especial).
- (A) Incorreta: Agrupamento dos dados (clustering) é uma técnica que organiza dados semelhantes em grupos, mas não tem como foco principal encontrar valores anômalos; ela busca padrões de similaridade, não desvios.
- (B) Incorreta: Análise de associações busca regras do tipo "quem compra A, também compra B" (como em market basket analysis), focando em correlações entre itens, não em valores extremos.
- (C) Incorreta: Análise de segmentação é um termo genérico para dividir a base em partes homogêneas (segmentos), mas o enunciado fala explicitamente em "identificar anomalias ou resultados raros", que é o objetivo da detecção de desvios, não da segmentação.
- (D) Correta: O texto descreve exatamente a análise de outliers (pontos fora da curva) ou detecção de desvios: identificar valores raros ou anômalos na base para tratá-los ou descartá-los, garantindo a qualidade dos dados antes da modelagem.
- (E) Incorreta: Classificação dos dados e das anomalias é uma etapa posterior; classificar significa rotular dados em categorias predefinidas (ex: "normal" vs "anômalo"), mas a tarefa descrita é a detecção inicial desses desvios, não a criação de um modelo de classificação. A pegadinha aqui é que "classificar anomalias" parece fazer sentido, mas a ação primária descrita é encontrar os pontos raros, não classificá-los.
Fonte: CESGRANRIO BB 01/2022 Escriturário - Agente de Tecnologia (Caderno Gabarito 1). Reproduzida para fins de estudo.