O auditor de contas públicas João está desenvolvendo um modelo de aprendizado de máquina para identificar transações financeiras suspeitas em uma auditoria de contas. Após treinar o modelo, João observa que esse tem um desempenho excelente nos dados de treinamento, mas apresenta um desempenho ruim nos dados de teste, com uma alta taxa de erro. Nesse contexto, o problema observado por João, do modelo ajustar-se excessivamente aos dados de treinamento, é denominado:
- A)bias (viés);
Bias (viés) é erro sistemático do modelo, mas não é o termo usado para o excesso de ajuste ao treinamento descrito na questão.
- B)overfitting;
Correta: overfitting é o sobreajuste, quando o modelo aprende demais o treinamento e piora na generalização.
- C)underfitting;
Underfitting é o subajuste, quando o modelo não aprende nem os padrões básicos e tem desempenho ruim até no treino.
- D)oversampling;
Oversampling é uma técnica para aumentar a representação de classes minoritárias, não o nome do problema de ajuste excessivo.
- E)undersampling.
Undersampling é uma técnica para reduzir a classe majoritária, também ligada a desbalanceamento, e não ao sobreajuste.
Gabarito: B
Quando um modelo vai muito bem nos dados de treinamento, mas decepciona nos dados de teste, o alerta acende para um problema clássico de aprendizado de máquina: ele decorou demais o treino e aprendeu pouco o padrão geral. É como estudar só uma prova antiga e achar que domina a matéria inteira. Na hora da prova nova, a surpresa aparece. Esse fenômeno recebe o nome de overfitting, ou sobreajuste. Em termos simples, o modelo fica complexo demais, captura até os ruídos e particularidades do conjunto de treinamento e, por isso, perde capacidade de generalizar para dados novos. Em auditoria, isso é péssimo, porque o objetivo é identificar transações suspeitas que não estavam no treino, e não apenas repetir o que já foi visto. Já o underfitting é o oposto: o modelo é fraco demais e não aprende nem os padrões básicos. Bias, por sua vez, está relacionado a erro sistemático e tende a aparecer junto com a discussão sobre viés-variância, mas não é o nome do problema descrito no enunciado. Oversampling e undersampling são técnicas para lidar com desbalanceamento de classes, não para definir esse tipo de erro de ajuste. Portanto, o gabarito é a letra B, porque o enunciado descreve exatamente um modelo que se ajustou excessivamente aos dados de treinamento e generalizou mal para os dados de teste.