Questão nº 84
Questão de Ciência de Dados · FGV TCE-PA 2024 (nº 84)
Alguns algoritmos de aprendizado de máquina servem para agrupar instâncias de dados em clusters, podendo ser utilizados para tarefas como segmentação de imagens, ou segmentação social (por exemplo, para agrupamento de clientes em uma mesma categoria.
Dois dos mais populares algoritmos são o K-means e o DBSCAN. A respeito desses algoritmos, relacione-os com suas principais características:
- K-means
- DBSCAN
( ) Precisa da definição de um número inicial de agrupamentos.
( ) Mais robusto à ocorrência de outliers, por sua provável localização em regiões de baixa densidade de dados.
( ) Precisa da definição do número mínimo de vizinhos e do raio da vizinhança para determinar limites dos agrupamentos.
( ) Determina centróides dos agrupamentos e agrupa as instâncias de dados em função de uma métrica de distância entre as instâncias e os centróides.
Assinale a opção que indica a relação correta, na sequência apresentada.
- A2 – 1 – 2 – 1.
- B1 – 1 – 2 – 1.
- C2 – 1 – 1 – 2.
- D2 – 1 – 1 – 1.
- E1 – 2 – 2 – 1. (alternativa correta)
Resposta comentada
Gabarito Alternativa E
Algoritmos de clusterização agrupam dados semelhantes em categorias (clusters) sem supervisão prévia. O K-means agrupa dados em um número pré-definido de clusters com base na proximidade a centróides, enquanto o DBSCAN encontra clusters de alta densidade, identificando pontos de ruído (outliers) e não exigindo um número fixo de clusters.
- (A) Incorreta: A sequência 2 – 1 – 2 – 1 está incorreta. A primeira afirmação ("Precisa da definição de um número inicial de agrupamentos") refere-se ao K-means (1), não ao DBSCAN (2).
- (B) Incorreta: A sequência 1 – 1 – 2 – 1 está incorreta. A segunda afirmação ("Mais robusto à ocorrência de outliers...") refere-se ao DBSCAN (2), não ao K-means (1). Esta é uma armadilha comum, pois o K-means é sensível a outliers, que podem distorcer os centróides.
- (C) Incorreta: A sequência 2 – 1 – 1 – 2 está incorreta. A primeira afirmação ("Precisa da definição de um número inicial de agrupamentos") refere-se ao K-means (1), não ao DBSCAN (2). A terceira afirmação ("Precisa da definição do número mínimo de vizinhos e do raio da vizinhança...") refere-se ao DBSCAN (2), não ao K-means (1).
- (D) Incorreta: A sequência 2 – 1 – 1 – 1 está incorreta. A primeira afirmação ("Precisa da definição de um número inicial de agrupamentos") refere-se ao K-means (1), não ao DBSCAN (2). A terceira afirmação ("Precisa da definição do número mínimo de vizinhos e do raio da vizinhança...") refere-se ao DBSCAN (2), não ao K-means (1).
- (E) Correta: A sequência 1 – 2 – 2 – 1 está correta.
- "Precisa da definição de um número inicial de agrupamentos." - K-means (1), pois o 'K' em K-means é o número de clusters.
- "Mais robusto à ocorrência de outliers, por sua provável localização em regiões de baixa densidade de dados." - DBSCAN (2), que identifica outliers como "pontos de ruído" (noise points) por estarem em regiões de baixa densidade. O K-means, ao contrário, tenta atribuir todos os pontos a um cluster, sendo sensível a outliers.
- "Precisa da definição do número mínimo de vizinhos e do raio da vizinhança para determinar limites dos agrupamentos." - DBSCAN (2), que utiliza os parâmetros
minPts(número mínimo de vizinhos) eepsilon(raio da vizinhança) para definir a densidade e expandir os clusters. - "Determina centróides dos agrupamentos e agrupa as instâncias de dados em função de uma métrica de distância entre as instâncias e os centróides." - K-means (1), que funciona iterativamente calculando centróides e atribuindo pontos ao centróide mais próximo.
Fonte: FGV TCE-PA 2024 Auditor de Controle Externo - Administrativa - Ciência de Dados (Caderno Tipo 1). Reproduzida para fins de estudo.