Marcelo, auditor especializado em Análise de Dados, está estudando o uso de algoritmos de aprendizado de máquina (Machine Learning) para a detecção de fraudes em contas públicas. Como parte de seus experimentos, ele dividiu seu conjunto de dados em treinamento e teste. Após treinar um modelo, percebeu que os resultados apresentavam indícios de underfitting. O underfitting ocorre
- A)quando o modelo se ajuste bem ao conjunto de treinamento, mas acaba por capturar não apenas os padrões, mas também os ruídos, comprometendo sua capacidade de generalização.
Errada, porque descreve overfitting: o modelo aprende até os ruídos do treinamento e perde generalização.
- B)apenas quando o conjunto de treinamento não contém exemplos de todas as classes, prejudicando o desempenho do modelo em classes minoritárias.
Errada, porque underfitting não depende de faltar exemplos de uma classe específica, e sim de o modelo não aprender os padrões do conjunto.
- C)quando o modelo não consegue capturar adequadamente os padrões nos dados do conjunto de treinamento, resultando em um desempenho insuficiente.
Certa, pois underfitting é justamente o ajuste insuficiente do modelo aos padrões dos dados, com desempenho baixo.
- D)quando a taxa de aprendizado do modelo é muito baixa, prolongando por exemplo o tempo necessário para que o modelo convirja.
Errada, porque taxa de aprendizado baixa pode atrasar a convergência, mas isso não define underfitting.
- E)quando o modelo apresenta uma complexidade muito maior do que o necessário, levando por exemplo ao uso ineficiente de recursos computacionais.
Errada, porque complexidade muito maior do que o necessário aponta para overfitting ou excesso de capacidade, não underfitting.
Gabarito: C
Underfitting é o famoso caso em que o modelo "aprendeu pouco demais". Em vez de enxergar os padrões importantes do conjunto de dados, ele fica simples demais, rígido demais ou mal ajustado, e por isso erra tanto no treino quanto no teste. Em prova, pense assim: se o modelo não consegue nem representar bem o que está acontecendo nos dados de treinamento, ele está subajustado. Isso costuma ocorrer quando a complexidade do modelo é insuficiente, quando faltam variáveis relevantes, quando há regularização excessiva ou quando o treinamento foi interrompido cedo demais. O resultado é um desempenho fraco, porque o modelo não captura a estrutura real do problema. Por isso o gabarito é a letra C: underfitting ocorre quando o modelo não consegue capturar adequadamente os padrões nos dados do conjunto de treinamento, resultando em desempenho insuficiente. Em linguagem de concurso, é o oposto de overfitting: aqui o problema não é decorar ruído, mas sim não aprender o bastante. Como referência doutrinária em aprendizado de máquina, a literatura distingue claramente underfitting e overfitting pela relação entre complexidade do modelo e capacidade de generalização. A ideia central é simples: modelo muito fraco subajusta; modelo muito complexo pode superajustar.