A analista Carla recebeu a tarefa de implementar uma solução algorítmica para classificar os processos arquivados no TJRN entre aqueles que foram ganhos e aqueles que foram perdidos. Na primeira abordagem, Carla se baseou no algoritmo de machine learning que, aplicado à classificação binária, divide os dados de entrada em duas regiões separadas por uma reta. Ao fim do algoritmo, a distância da reta para o dado mais próximo de cada região é a mesma e a maior possível. Sendo assim, na primeira abordagem, Carla utilizou como base o algoritmo de machine learning:
- A)K-Médias;
Errada: K-Médias é técnica de agrupamento não supervisionado, não um classificador binário com reta de separação e margem máxima.
- B)Regressão Linear;
Errada: Regressão Linear estima valores contínuos e não é o algoritmo típico de classificação binária descrito no enunciado.
- C)Regressão Logística;
Errada: Regressão Logística é usada em classificação, mas não trabalha com a ideia de maximizar a distância da fronteira aos pontos mais próximos.
- D)K-Vizinhos Mais Próximos;
Errada: K-Vizinhos Mais Próximos classifica pela vizinhança dos exemplos, sem criar uma reta separadora com margem máxima.
- E)Máquina de Vetores de Suporte.
Certa: a Máquina de Vetores de Suporte procura exatamente um hiperplano que separe as classes com a maior margem possível.
Gabarito: E
A questão descreve um classificador binário que separa os dados em duas regiões por uma reta e, ao final, busca a maior margem possível entre essa reta e os pontos mais próximos de cada lado. Isso é a cara da Máquina de Vetores de Suporte (SVM). A ideia central da SVM é justamente encontrar um hiperplano de separação com margem máxima, ou seja, a fronteira fica o mais longe possível dos exemplos de cada classe que estão “encostando” nela. Em problemas de classificação binária, a SVM tenta não só separar, mas separar com folga. Essa folga é importante porque costuma melhorar a capacidade de generalização do modelo, reduzindo o risco de ele decorar os dados de treino e ir mal em dados novos. Os pontos que ficam mais próximos da fronteira são chamados de vetores de suporte, e são eles que “seguram” a posição da reta. Por isso, o enunciado matou a questão ao falar em divisão por reta e máxima distância aos dados mais próximos de cada região. Isso é o princípio da margem máxima, típico da SVM. Já ferramentas como regressão logística classificam, mas não são definidas por essa construção geométrica de margem máxima. Em resumo: separou por reta, com maior margem possível e apoio nos pontos mais próximos? Pense em SVM. É um daqueles casos em que a banca coloca a descrição bonitinha e, se você reconhecer o cheiro de margem máxima, já marca sem medo.