Uma biblioteca está classificando os seus frequentadores em grupos literários para facilitar a aquisição e a organização dos livros. Isso foi feito aplicando o algoritmo KNN ao banco de dados de usuários da biblioteca, incluindo alguns dos campos de informação como atributos, tais como idade e nível de formação acadêmica. Em um experimento, uma segunda classificação foi feita usando um conjunto maior de atributos, incluindo ambos de maior ou menor relevância percebida com relação aos grupos definidos. A segunda classificação tende a ser:
- A)diferente da primeira, pois o algoritmo perde acurácia com o aumento da quantidade de atributos;
Errada, porque o aumento de atributos não implica, por si só, perda de acurácia; isso depende de quais atributos foram incluídos.
- B)próxima à primeira, pois o algoritmo é robusto a ruído nos dados;
Errada, porque o KNN não é particularmente robusto a ruído nos dados quando esse ruído afeta a distância entre observações.
- C)diferente da primeira, pois o algoritmo sofrerá underfitting;
Errada, porque underfitting é típico de modelos excessivamente simples e não explica diretamente o efeito de adicionar atributos irrelevantes ao KNN.
- D)próxima à primeira, pois o algoritmo pode balancear a influência dos atributos mais e menos relevantes;
Errada, porque o KNN não “balanceia” sozinho a influência de atributos relevantes e irrelevantes; sem tratamento adequado, os atributos ruins podem distorcer a distância.
- E)diferente da primeira, pois o algoritmo é sensível a atributos não relevantes.
Certa, porque o KNN depende fortemente da distância e, por isso, atributos não relevantes podem alterar bastante o resultado da classificação.
Gabarito: E
O KNN é um algoritmo de classificação baseado na proximidade entre registros: ele olha quem está mais perto do novo caso para decidir a classe. Parece simples, quase como perguntar para os vizinhos, mas tem uma armadilha importante: a escolha dos atributos influencia muito o resultado. Se você coloca variáveis relevantes, como idade e formação, o modelo costuma enxergar bem os grupos. Mas, quando entram muitos atributos pouco úteis ou irrelevantes, a medida de distância fica “poluída” e os vizinhos mais próximos podem deixar de ser realmente parecidos. Esse comportamento acontece porque o KNN não aprende um conjunto de regras internas como outros modelos; ele depende diretamente da geometria dos dados. Em alta dimensão, atributos sem relação com a classe podem distorcer as distâncias, fazendo com que casos de classes diferentes pareçam próximos apenas por ruído. É o famoso problema da maldição da dimensionalidade, que atrapalha bastante métodos baseados em distância. Por isso, ao aumentar o conjunto de atributos com variáveis de maior ou menor relevância, a tendência é a classificação mudar em relação à primeira, não porque o modelo ficou “mais esperto”, mas porque ficou mais sensível a informação ruim. Em termos práticos: mais atributos não significam automaticamente melhor KNN. Às vezes, significa mais confusão. Assim, o gabarito é a letra E, porque o KNN é sensível a atributos não relevantes. Isso é um ponto clássico em teoria de classificação e em técnicas de aprendizado supervisionado: no KNN, a qualidade das variáveis importa muito, e a seleção/escala de atributos costuma ser decisiva para o desempenho.