Questão nº 58
Questão de Tecnologia da Informação · CEBRASPE SEFAZ-RN 2025 - P2 Conhecimentos Complementares (nº 58)
No âmbito do aprendizado de máquina não supervisionado, os algoritmos de agrupamento (clustering) apresentam diferentes abordagens para a organização de dados sem rótulos. Considerando as propriedades operacionais dos algoritmos k-means, DBSCAN e SOM (self-organizing maps), assinale a opção correta.
- AO DBSCAN e o SOM operam sob a mesma função de custo baseada na minimização da soma dos erros quadráticos (SSE) em relação a um ponto central fixo.
- BO k-means é um algoritmo de particionamento que minimiza a variância intracluster, sendo inerentemente robusto quanto à presença de outliers devido ao uso da média aritmética para o cálculo dos centroides.
- CO DBSCAN fundamenta-se na densidade local de pontos, permitindo a identificação de agrupamentos de formas geométricas arbitrárias e a segregação de ruído, prescindindo da especificação prévia do número de clusters. (alternativa correta)
- DO SOM utiliza uma arquitetura de rede neural competitiva para realizar a redução de dimensionalidade e o agrupamento, garantindo a preservação da topologia global sem a necessidade de definir uma vizinhança entre os neurônios.
- EO k-means apresenta desempenho superior ao DBSCAN na detecção de agrupamentos não convexos ou com densidades significativamente distintas.
Resposta comentada
Gabarito Alternativa C
Conceito-chave: Clustering é a tarefa de agrupar dados sem rótulos por similaridade. Cada algoritmo tem uma "lógica" diferente: o k-means separa por distância a centróides (médias), o DBSCAN por densidade de vizinhança, e o SOM por competição entre neurônios em uma grade. A pegadinha clássica é confundir essas lógicas ou atribuir propriedades que o algoritmo não tem.
- (A) Incorreta: DBSCAN não usa função de custo SSE nem centróides fixos; ele agrupa por densidade conectada, enquanto o SOM usa competição e atualização de pesos, não minimização de SSE em relação a um ponto central.
- (B) Incorreta: O k-means minimiza a variância intracluster, mas é sensível a outliers justamente porque a média aritmética é puxada por valores extremos — a banca tenta te fazer acreditar no oposto.
- (C) Correta: O DBSCAN define clusters como regiões de alta densidade separadas por regiões de baixa densidade, identificando formas arbitrárias (não convexas) e marcando pontos isolados como ruído; ele não exige que você informe o número de clusters antecipadamente — apenas os parâmetros de raio (eps) e densidade mínima (minPts).
- (D) Incorreta: O SOM exige a definição de uma vizinhança entre neurônios (grade topológica) para preservar a topologia; sem isso, não há mapeamento ordenado. A banca inverte a condição.
- (E) Incorreta: O k-means falha em agrupamentos não convexos (ex.: anéis) e com densidades muito diferentes, pois assume grupos esféricos e de tamanho similar; o DBSCAN é superior nesses casos, não o contrário.
Fonte: CEBRASPE SEFAZ-RN 2025 - P2 Conhecimentos Complementares Auditor Fiscal de Receitas Estaduais. Reproduzida para fins de estudo.