A analista Carla implementou uma solução algorítmica que classifica os novos processos submetidos à PGM de Niterói em níveis de indício de fraude. Para atingir este objetivo, Carla se baseou no algoritmo de machine learning para classificação que atribui, necessariamente, um valor no intervalo numérico de 0 a 1 para cada entrada. Carla utilizou como base o algoritmo de machine learning:
- A)Regressão Linear;
Errada, porque regressao linear produz valores continuos sem restricao ao intervalo de 0 a 1.
- B)Árvore de Decisão;
Errada, porque arvore de decisao classifica por regras de divisao, mas nao obrigatoriamente gera saida probabilistica entre 0 e 1.
- C)Regressão Logística;
Certa, porque a regressao logistica estima probabilidade e retorna valor no intervalo de 0 a 1.
- D)Floresta Randômica;
Errada, porque a floresta randomica e um conjunto de arvores de decisao e nao corresponde à definicao dada no enunciado.
- E)Máquina de Vetores de Suporte
Errada, porque a maquina de vetores de suporte separa classes por margem, sem a exigencia de saida numerica entre 0 e 1.
Gabarito: C
Quando voce pensa em classificar algo em duas categorias, como “tem indício de fraude” ou “não tem”, existe um algoritmo bem famoso que transforma a entrada em uma probabilidade. Esse é o papel da regressão logística: ela nao prevê um valor qualquer, mas sim um numero entre 0 e 1, que pode ser interpretado como chance de pertencimento a uma classe. Depois, com um limiar (por exemplo, 0,5), decide-se a classificacao final. A sacada da questao esta justamente nessa pista: “atribui, necessariamente, um valor no intervalo numerico de 0 a 1 para cada entrada”. Isso remete diretamente à funcao sigmoide, usada pela regressao logistica para “apertar” o resultado dentro desse intervalo. Em concursos, quando a banca fala em probabilidade de classe ou saida entre 0 e 1, acenda a luz amarela para regressao logistica. Ja a regressao linear tenta prever um valor continuo, podendo dar qualquer numero, inclusive negativo ou acima de 1. Arvore de decisao, floresta randomica e SVM sao tecnicas de classificacao, mas nao sao conhecidas por devolver necessariamente uma saida no intervalo 0 a 1 para cada entrada. Por isso, o gabarito correto é a letra C. Em termos doutrinarios de aprendizado de maquina, a regressao logistica é o classificador probabilistico classico: ela estima a probabilidade de uma classe com base em uma combinacao linear dos atributos e, depois, aplica uma funcao de ativacao. Simples, elegante e muito cobrada em prova.