Questão nº 82
Questão de Ciência de Dados · FGV TCE-PA 2024 (nº 82)
Diferentes técnicas de classificação são utilizadas em aprendizado de máquina para organizar e categorizar dados de acordo com características predefinidas.
Com respeito a técnicas de classificação em aprendizado de máquina, analise as afirmativas a seguir.
I. A regressão logística determina um hiperplano no espaço -dimensional para separar as instâncias de dados de entrada em partições de acordo com suas classes.
II. As máquinas de vetores de suporte (Support Vector Machines - SVM) consistem em uma abordagem probabilística, determinando uma distribuição de probabilidades de que uma nova instância de dados de entrada pertença as respectivas classes.
III. O algoritmo K vizinhos mais próximos (K Nearest Neighbors - KNN) classifica uma nova instância de dados de entrada conforme a classe das instâncias mais próximas já observadas.
Está correto o que se afirma em
- AI, apenas.
- BII, apenas.
- CIII, apenas. (alternativa correta)
- DI e II, apenas.
- EI, II e III.
Resposta comentada
Gabarito Alternativa C
O conceito-chave é que cada algoritmo de classificação tem uma estratégia matemática diferente para separar ou agrupar dados: alguns desenham fronteiras geométricas (hiperplanos), outros calculam probabilidades, e outros medem distâncias entre pontos. A pegadinha clássica é trocar as definições entre os algoritmos, então você precisa associar cada técnica à sua "arma" específica.
- (A) Incorreta: A afirmação I descreve corretamente o SVM (que acha um hiperplano), mas a atribui à regressão logística, que na verdade usa uma função sigmoide para estimar probabilidades de pertencer a uma classe, não um hiperplano rígido.
- (B) Incorreta: A afirmação II inverte os papéis: quem usa distribuição de probabilidades é a regressão logística (e outros modelos probabilísticos), enquanto o SVM busca o hiperplano de margem máxima, sem modelar probabilidades diretamente.
- (C) Correta: A afirmação III está certa: o KNN é um algoritmo baseado em instâncias (lazy learning) que classifica um novo ponto pela votação majoritária das classes dos vizinhos mais próximos no espaço de características, usando uma métrica de distância (ex.: euclidiana).
- (D) Incorreta: Como I e II estão erradas (são definições trocadas), a combinação "I e II" não pode ser correta.
- (E) Incorreta: Como apenas III é verdadeira, a opção "I, II e III" falha por incluir as duas afirmações falsas.
Armadilha da banca: O distrator mais tentador é a letra A (I, apenas), porque a frase I parece tecnicamente plausível (hiperplano separa classes), mas a banca trocou o nome do algoritmo — quem faz isso é SVM, não regressão logística. Memorize: regressão logística = probabilidade; SVM = hiperplano; KNN = distância/vizinhos.
Fonte: FGV TCE-PA 2024 Auditor de Controle Externo - Administrativa - Ciência de Dados (Caderno Tipo 1). Reproduzida para fins de estudo.