O cientista de dados João deverá criar um modelo de aprendizado de máquina com o objetivo de classificar transações de cartão de crédito como "fraudulentas" ou "não fraudulentas". Dentre as métricas de avaliação da qualidade geral do modelo criado, João deverá utilizar a que avalia o equilíbrio entre precisão e sensibilidade (recall):
- A)acurácia;
Errada, porque acuracia mede o percentual total de acertos, mas pode enganar bastante em bases desbalanceadas.
- B)F1-score;
Certa, porque o F1-score sintetiza o equilibrio entre precisao e sensibilidade (recall) pela media harmonica.
- C)especificidade;
Errada, porque especificidade mede a taxa de verdadeiros negativos, nao o equilibrio entre precisao e recall.
- D)índice Jaccard (J);
Errada, porque o indice Jaccard avalia sobreposicao entre conjuntos e nao e a metrica padrao para esse equilibrio.
- E)área sob a curva ROC (AUC-ROC).
Errada, porque a AUC-ROC mede capacidade discriminatoria global do classificador, nao o balanço direto entre precisao e recall.
Gabarito: B
Quando voce avalia um classificador de fraude, nao basta olhar so para quantos casos ele acertou no total. Em problemas assim, normalmente ha desbalanceamento de classes, ou seja, muito mais transacoes normais do que fraudulentas. Por isso, uma metrica que combine bem o quanto o modelo acerta os positivos e o quanto ele nao exagera nos falsos alarmes faz bem mais sentido do que a simples acuracia. O equilibrio entre precisao e sensibilidade e medido pelo F1-score. A precisao mostra, entre tudo que o modelo marcou como fraude, quantas eram realmente fraude. A sensibilidade, ou recall, mostra, entre todas as fraudes reais, quantas o modelo conseguiu encontrar. O F1-score junta essas duas visoes em uma so medida, por meio da media harmonica, penalizando modelos que vao bem em uma e mal na outra. Em outras palavras: se o modelo detecta muitas fraudes, mas sai acusando transacoes inocentes demais, ou se e muito conservador e deixa fraudes passarem, o F1-score revela esse desequilibrio. Ele e muito usado justamente em classificacao binaria com classes desiguais, como fraude, spam e doencas raras. A FGV costuma cobrar essa ideia de forma bem direta: quando a pergunta fala em equilibrio entre precisao e recall, pense imediatamente em F1-score. Nao ha misterio, so o classico casamento entre "nao alarmar demais" e "nao deixar passar o problema".