Questão nº 82
Questão de Ciência de Dados · FGV TCE-PA 2024 (nº 82)
Diferentes técnicas de classificação são utilizadas em aprendizado de máquina para organizar e categorizar dados de acordo com características predefinidas.
Com respeito a técnicas de classificação em aprendizado de máquina, analise as afirmativas a seguir.
I. A regressão logística determina um hiperplano no espaço -dimensional para separar as instâncias de dados de entrada em partições de acordo com suas classes.
II. As máquinas de vetores de suporte (Support Vector Machines - SVM) consistem em uma abordagem probabilística, determinando uma distribuição de probabilidades de que uma nova instância de dados de entrada pertença as respectivas classes.
III. O algoritmo K vizinhos mais próximos (K Nearest Neighbors - KNN) classifica uma nova instância de dados de entrada conforme a classe das instâncias mais próximas já observadas.
Está correto o que se afirma em
- AI, apenas.
- BII, apenas.
- CIII, apenas. (alternativa correta)
- DI e II, apenas.
- EI, II e III.
Resposta comentada
Gabarito Alternativa C
Classificação em aprendizado de máquina é o processo de ensinar um computador a categorizar novos dados em grupos predefinidos (chamados classes), com base em exemplos que ele já viu. Por exemplo, classificar um e-mail como "spam" ou "não spam".
- (A) Incorreta: A regressão logística modela a probabilidade de uma instância pertencer a uma classe, e a decisão de classificação é feita aplicando um limiar a essa probabilidade. Embora a fronteira de decisão resultante seja um hiperplano (uma linha em 2D, um plano em 3D, ou uma superfície mais complexa em dimensões maiores), o algoritmo não "determina um hiperplano para separar" como seu objetivo principal, mas sim ajusta um modelo probabilístico. A armadilha da banca aqui é que, embora o resultado da decisão seja um hiperplano, a descrição do mecanismo primário não é precisa para a regressão logística, que foca na modelagem da probabilidade, e não na busca direta por um hiperplano separador como ocorre no SVM.
- (B) Incorreta: As Máquinas de Vetores de Suporte (SVM) são algoritmos discriminativos que buscam o hiperplano ótimo que maximiza a margem entre as classes. Elas não são intrinsecamente abordagens probabilísticas; elas fornecem uma decisão de classe, não uma distribuição de probabilidades.
- (C) Correta: O algoritmo K Vizinhos Mais Próximos (KNN) é um método não-paramétrico que classifica uma nova instância de dados identificando as
Kinstâncias de treinamento mais próximas a ela no espaço de características e atribuindo a classe mais frequente entre esses vizinhos. Esta afirmação descreve corretamente o funcionamento fundamental do KNN.
Fonte: FGV TCE-PA 2024 Auditor de Controle Externo - Administrativa - Ciência de Dados (Caderno Tipo 1). Reproduzida para fins de estudo.