Existem diversos algoritmos de classificação que são amplamente utilizados na resolução de problemas que envolvam problemas de aprendizado de máquina. Com relação aos algoritmos de classificação, analise as afirmativas a seguir. I. A regressão logística é um algoritmo muito utilizado em ciências biológicas e ciências sociais, ela deve ser usada em problemas de classificação binários, ou seja, problemas para os quais os dados devam ser classificados entre dois grupos distintos e mutuamente excludentes. II. SVM é um algoritmo cujo objetivo é traçar uma ou mais retas que divida(m) de maneira aproximadamente equitativa, com margem máxima, um conjunto de pontos de um espaço vetorial, que representam os dados do problema estudado. Ele trabalha apenas com dados linearmente separáveis, o que pode, eventualmente, limitar sua aplicação. III. Árvore de decisão é um algoritmo de aprendizagem não supervisionada, que tem uma variável destino predeterminada. A função da árvore é separar subconjuntos de dados que tenham alguma característica comum, essa característica é chamada de diferenciador e é significativa em relação às variáveis de entrada que podem ser categóricas ou contínuas. Está correto o que se afirma em
- A)II e III, apenas.
Errada, porque a afirmativa II está incorreta e a III também erra ao chamar árvore de decisão de aprendizagem não supervisionada.
- B)I e II, apenas.
Certa, porque apenas a afirmativa I está correta: regressão logística é usada em classificação binária, enquanto II e III trazem erros conceituais.
- C)I e III, apenas.
Errada, porque a afirmativa III está falsa ao descrever árvore de decisão como não supervisionada.
- D)III, apenas.
Errada, porque a afirmativa III não está correta e a questão não se limita a ela.
- E)I, apenas.
Certa, porque a regressão logística realmente é indicada para classificação binária, e as demais afirmativas trazem incorreções.
Gabarito: E
A questão mistura três clássicos da classificação em aprendizado de máquina. A primeira afirmação está correta: a regressão logística é muito usada para problemas de classificação binária, como sim/não, verdadeiro/falso, presença/ausência. Ela estima a probabilidade de um evento e, por isso, combina muito bem com dois grupos mutuamente excludentes. Em ciências biológicas e sociais, aparece bastante justamente para esse tipo de decisão.