← Questões de Estatística

Estatística · FGV · 2022

Questão comentada de Estatística

Uma biblioteca está classificando os seus frequentadores em grupos literários para facilitar a aquisição e a organização dos livros. Isso foi feito aplicando o algoritmo KNN ao banco de dados de usuários da biblioteca, incluindo alguns dos campos de informação como atributos, tais como idade e nível de formação acadêmica. Em um experimento, uma segunda classificação foi feita usando um conjunto maior de atributos, incluindo ambos de maior ou menor relevância percebida com relação aos grupos definidos. A segunda classificação tende a ser:

Gabarito: E

O KNN é um algoritmo de classificação baseado na proximidade entre registros: ele olha quem está mais perto do novo caso para decidir a classe. Parece simples, quase como perguntar para os vizinhos, mas tem uma armadilha importante: a escolha dos atributos influencia muito o resultado. Se você coloca variáveis relevantes, como idade e formação, o modelo costuma enxergar bem os grupos. Mas, quando entram muitos atributos pouco úteis ou irrelevantes, a medida de distância fica “poluída” e os vizinhos mais próximos podem deixar de ser realmente parecidos. Esse comportamento acontece porque o KNN não aprende um conjunto de regras internas como outros modelos; ele depende diretamente da geometria dos dados. Em alta dimensão, atributos sem relação com a classe podem distorcer as distâncias, fazendo com que casos de classes diferentes pareçam próximos apenas por ruído. É o famoso problema da maldição da dimensionalidade, que atrapalha bastante métodos baseados em distância. Por isso, ao aumentar o conjunto de atributos com variáveis de maior ou menor relevância, a tendência é a classificação mudar em relação à primeira, não porque o modelo ficou “mais esperto”, mas porque ficou mais sensível a informação ruim. Em termos práticos: mais atributos não significam automaticamente melhor KNN. Às vezes, significa mais confusão. Assim, o gabarito é a letra E, porque o KNN é sensível a atributos não relevantes. Isso é um ponto clássico em teoria de classificação e em técnicas de aprendizado supervisionado: no KNN, a qualidade das variáveis importa muito, e a seleção/escala de atributos costuma ser decisiva para o desempenho.

Continue treinando

Questões relacionadas