← Questões de Engenharia de Software

Engenharia de Software · FGV · 2024

Questão comentada de Engenharia de Software

O auditor de contas públicas João está desenvolvendo um modelo de aprendizado de máquina para identificar transações financeiras suspeitas em uma auditoria de contas. Após treinar o modelo, João observa que esse tem um desempenho excelente nos dados de treinamento, mas apresenta um desempenho ruim nos dados de teste, com uma alta taxa de erro. Nesse contexto, o problema observado por João, do modelo ajustar-se excessivamente aos dados de treinamento, é denominado:

Gabarito: B

Quando um modelo vai muito bem nos dados de treinamento, mas decepciona nos dados de teste, o alerta acende para um problema clássico de aprendizado de máquina: ele decorou demais o treino e aprendeu pouco o padrão geral. É como estudar só uma prova antiga e achar que domina a matéria inteira. Na hora da prova nova, a surpresa aparece. Esse fenômeno recebe o nome de overfitting, ou sobreajuste. Em termos simples, o modelo fica complexo demais, captura até os ruídos e particularidades do conjunto de treinamento e, por isso, perde capacidade de generalizar para dados novos. Em auditoria, isso é péssimo, porque o objetivo é identificar transações suspeitas que não estavam no treino, e não apenas repetir o que já foi visto. Já o underfitting é o oposto: o modelo é fraco demais e não aprende nem os padrões básicos. Bias, por sua vez, está relacionado a erro sistemático e tende a aparecer junto com a discussão sobre viés-variância, mas não é o nome do problema descrito no enunciado. Oversampling e undersampling são técnicas para lidar com desbalanceamento de classes, não para definir esse tipo de erro de ajuste. Portanto, o gabarito é a letra B, porque o enunciado descreve exatamente um modelo que se ajustou excessivamente aos dados de treinamento e generalizou mal para os dados de teste.

Continue treinando

Questões relacionadas