Questão nº 64
Questão de Estatística · FGV MP-SC 2022 (nº 64)
Uma biblioteca está classificando os seus frequentadores em grupos literários para facilitar a aquisição e a organização dos livros. Isso foi feito aplicando o algoritmo KNN ao banco de dados de usuários da biblioteca, incluindo alguns dos campos de informação como atributos, tais como idade e nível de formação acadêmica. Em um experimento, uma segunda classificação foi feita usando um conjunto maior de atributos, incluindo ambos de maior ou menor relevância percebida com relação aos grupos definidos.
A segunda classificação tende a ser:
- Adiferente da primeira, pois o algoritmo perde acurácia com o aumento da quantidade de atributos;
- Bpróxima à primeira, pois o algoritmo é robusto a ruído nos dados;
- Cdiferente da primeira, pois o algoritmo sofrerá underfitting;
- Dpróxima à primeira, pois o algoritmo pode balancear a influência dos atributos mais e menos relevantes;
- Ediferente da primeira, pois o algoritmo é sensível a atributos não relevantes. (alternativa correta)
Resposta comentada
Gabarito Alternativa E
O KNN classifica um ponto olhando a distância (geralmente euclidiana) até os vizinhos mais próximos. Se você adiciona atributos irrelevantes (ruído), essas dimensões extras “empurram” os pontos no espaço, distorcendo o cálculo da distância e mudando quem são os vizinhos. Ou seja, o KNN não filtra atributos inúteis sozinho — ele é muito sensível a eles.
- (A) Incorreta: O KNN não “perde acurácia” por definição ao aumentar atributos; o problema é especificamente a presença de atributos não relevantes, não a quantidade em si (se todos fossem relevantes, poderia até melhorar).
- (B) Incorreta: O KNN não é robusto a ruído; pelo contrário, é um dos algoritmos mais sensíveis a atributos irrelevantes, pois eles alteram diretamente as distâncias entre os pontos.
- (C) Incorreta: Underfitting é quando o modelo é simples demais para captar padrões (ex.: K muito grande). Aqui o problema é o oposto: dimensões extras criam overfitting ou apenas ruído, não underfitting.
- (D) Incorreta: O KNN não balanceia a influência dos atributos por padrão — ele dá peso igual a todas as dimensões na distância. Atributos menos relevantes têm o mesmo impacto que os mais relevantes, poluindo o cálculo.
- (E) Correta: O KNN calcula a distância usando todos os atributos igualmente; atributos não relevantes (ruído) “puxam” os pontos em direções sem sentido, alterando a vizinhança e, portanto, a classificação final — logo, a segunda classificação tende a ser diferente da primeira.
Armadilha do distrator (B): A banca tenta te fazer acreditar que “mais dados = mais robustez”. Mas no KNN, mais atributos irrelevantes = mais ruído no espaço vetorial — o algoritmo não tem mecanismo para ignorá-los, então a resposta correta é a E, não a B.
Fonte: FGV MP-SC 2022 Analista de Dados e Pesquisas (Caderno Tipo 1). Reproduzida para fins de estudo.