Questão nº 64

Questão de Tecnologia da Informação · FGV TCE-PA 2024 (nº 64)

FGV2024Auditor de Controle Externo - Informática - Analista de SistemasTecnologia da Informação
Gabarito: Ever comentário ↓

Alguns algoritmos de aprendizado de máquina servem para agrupar instâncias de dados em clusters, podendo ser utilizados para tarefas como segmentação de imagens, ou segmentação social (por exemplo, para agrupamento de clientes em uma mesma categoria.
Dois dos mais populares algoritmos são o K-means e o DBSCAN. A respeito desses algoritmos, relacione-os com suas principais características:

  1. K-means
  2. DBSCAN

( ) Precisa da definição de um número inicial de agrupamentos.
( ) Mais robusto à ocorrência de outliers, por sua provável localização em regiões de baixa densidade de dados.
( ) Precisa da definição do número mínimo de vizinhos e do raio da vizinhança para determinar limites dos agrupamentos.
( ) Determina centróides dos agrupamentos e agrupa as instâncias de dados em função de uma métrica de distância entre as instâncias e os centróides.

Das opções a seguir, aquela que indica a relação correta na sequência apresentada é

Resposta comentada

Gabarito Alternativa E

Agrupamento (Clustering) é uma técnica de aprendizado de máquina que organiza dados semelhantes em grupos, chamados clusters, sem que você precise dizer ao algoritmo como esses grupos devem ser formados. O K-means é um algoritmo que divide os dados em um número pré-definido de grupos (k), encontrando o "centro" de cada grupo (o centróide) e atribuindo cada ponto ao centróide mais próximo. O DBSCAN (Density-Based Spatial Clustering of Applications with Noise) é um algoritmo que encontra grupos de dados baseando-se na densidade de pontos, ou seja, ele agrupa pontos que estão próximos uns dos outros em regiões densas e marca pontos isolados como "ruído" (outliers).

Analisando cada afirmação:

  1. ( ) Precisa da definição de um número inicial de agrupamentos. Esta é uma característica do K-means (1), que exige que o usuário especifique o número k de clusters desejados. O DBSCAN não precisa dessa informação.
  2. ( ) Mais robusto à ocorrência de outliers, por sua provável localização em regiões de baixa densidade de dados. Esta é uma característica do DBSCAN (2). O DBSCAN é capaz de identificar pontos de baixa densidade como "ruído" ou outliers, sem incluí-los em nenhum cluster. O K-means, por outro lado, é sensível a outliers, pois eles podem distorcer a posição dos centróides.
  3. ( ) Precisa da definição do número mínimo de vizinhos e do raio da vizinhança para determinar limites dos agrupamentos. Estes são os parâmetros fundamentais do DBSCAN (2): minPts (número mínimo de vizinhos) e epsilon (raio da vizinhança).
  4. ( ) Determina centróides dos agrupamentos e agrupa as instâncias de dados em função de uma métrica de distância entre as instâncias e os centróides. Esta é a operação central do K-means (1), que funciona de forma iterativa calculando centróides e atribuindo pontos a eles com base na distância.

A sequência correta é, portanto, 1 – 2 – 2 – 1.

(A) Incorreta: A sequência 2 – 1 – 2 – 1 está errada porque o DBSCAN (2) não precisa de um número inicial de agrupamentos, e o K-means (1) não é robusto a outliers.
(B) Incorreta: A sequência 1 – 1 – 2 – 1 está errada porque o K-means (1) não é mais robusto a outliers; na verdade, ele é bastante sensível a eles. (Armadilha da banca) Este é um distrator comum, pois muitos estudantes podem superestimar a robustez do K-means ou confundir sua popularidade com uma capacidade de lidar bem com todas as situações, incluindo outliers. É crucial lembrar que outliers podem puxar os centróides do K-means, distorcendo os clusters.
(C) Incorreta: A sequência 2 – 1 – 1 – 2 está errada em várias posições, como atribuir a necessidade de número inicial de agrupamentos ao DBSCAN (2) e a robustez a outliers ao K-means (1).
(D) Incorreta: A sequência 2 – 1 – 1 – 1 está errada porque o DBSCAN (2) não precisa de um número inicial de agrupamentos, e o K-means (1) não é robusto a outliers. Além disso, os parâmetros de vizinhança são do DBSCAN, não do K-means.
(E) Correta: A sequência 1 – 2 – 2 – 1 corresponde perfeitamente às características de cada algoritmo: K-means precisa de k; DBSCAN é robusto a outliers; DBSCAN usa vizinhança e número mínimo de vizinhos; K-means usa centróides e métrica de distância.

Fonte: FGV TCE-PA 2024 Auditor de Controle Externo - Informática - Analista de Sistemas (Caderno Tipo 1). Reproduzida para fins de estudo.

Continue estudando

Estudar é izi

Pratique milhares de questões como esta, de graça, com explicação e gamificação no Quizinho.

Estudar de graça no Quizinho