Sobre algoritmos de mineração de dados, avalie as afirmativas a seguir e assinale (V) para a verdadeira e (F) para a falsa. ( ) K-means, também conhecido como K-NN, é um algoritmo baseado na ideia de que objetos semelhantes estão próximos uns dos outros. ( )Árvore de decisão é uma estrutura hierárquica constituída por nós. Nela, o coeficiente de Gini de um nó é sempre maior do que o do seu nó pai. ( ) O algoritmo SVM, utilizado apenas para a tarefa de classificação, emprega classificadores lineares que separam o conjunto de dados por meio de hiperplanos, não sendo possível seu uso com problemas não linearmente separáveis. As afirmativas são, respectivamente,
- A)V – V – F.
Errada, porque a primeira e a segunda afirmativas estão incorretas, embora a terceira também seja falsa.
- B)F – V – V.
Errada, porque a primeira afirmativa é falsa e a terceira também é falsa, não verdadeira.
- C)F – F – V.
Errada, porque a terceira afirmativa é falsa, já que o SVM não se limita a problemas linearmente separáveis e não é usado apenas em classificação.
- D)V – F – F.
Errada, porque a primeira afirmativa não é verdadeira e a segunda também não.
- E)F – F – F.
Certa, porque as três afirmativas são falsas.
Gabarito: E
Em mineração de dados, é comum misturar conceitos parecidos, e a banca adora essa confusão. Aqui, a primeira afirmativa erra feio ao tratar K-means como se fosse K-NN: K-means é um algoritmo de agrupamento (clustering), enquanto K-NN é de classificação e usa vizinhança, não é a mesma coisa. Além disso, K-means trabalha justamente com a ideia de proximidade entre objetos para formar grupos, mas isso não o transforma em K-NN. A segunda afirmativa também está errada. Em árvore de decisão, o objetivo é dividir os dados de forma a reduzir a impureza dos nós filhos, então o índice de Gini tende a diminuir, e não aumentar, em relação ao nó pai. Ou seja, a lógica da árvore é melhorar as separações a cada divisão, não piorá-las. A terceira afirmativa erra por excesso de restrição. O SVM não serve apenas para classificação, pois também pode ser usado em regressão (SVR). E ele não fica preso a problemas linearmente separáveis: com o truque do kernel, consegue lidar com separações não lineares. Por isso, as três afirmativas são falsas, fechando o gabarito E.