Com relação ao ajuste de dados e a aplicação de modelos preditivos de aprendizado de máquina, analise os itens a seguir. I. O subajuste (underfitting) indica baixa capacidade preditiva do modelo para os dados de treinamento. II. O superajuste (overfitting) impacta negativamente a capacidade de generalização do modelo. III. A presença de ruído nos dados favorece a ocorrência de superajuste (overfitting) do modelo. Está correto o que se afirma em
- A)I, apenas.
Errada, porque o item I está correto, mas os itens II e III também estão.
- B)I e II, apenas.
Errada, porque os itens I e II estão corretos, mas o item III também é verdadeiro.
- C)I e III, apenas.
Errada, porque o item III está correto, mas o item II também está.
- D)II e III, apenas.
Errada, porque os itens II e III estão corretos, mas o item I também está.
- E)I, II e III.
Certa, porque os itens I, II e III descrevem corretamente underfitting, overfitting e o efeito do ruído nos dados.
Gabarito: E
Quando falamos em ajuste de dados em aprendizado de máquina, a ideia central é simples: o modelo precisa aprender o padrão, mas sem decorar o treino como se fosse cola de prova. O subajuste (underfitting) acontece quando o modelo é simples demais ou foi treinado de forma insuficiente, então ele vai mal até nos próprios dados de treinamento. Por isso, o item I está correto: baixa capacidade preditiva no treino é um sinal típico de underfitting. Já o superajuste (overfitting) é o excesso de “memória” do modelo. Ele aprende não só o padrão real, mas também as particularidades e os ruídos do conjunto de treino, e aí funciona muito bem no treino, mas tropeça quando vê dados novos. Então o item II também está correto, porque overfitting prejudica exatamente a generalização. O item III também está certo: ruído nos dados aumenta a chance de o modelo confundir sujeira com padrão. Em vez de aprender a regra geral, ele tenta se adaptar às variações aleatórias, o que favorece o overfitting. Em termos práticos, quanto mais ruído e menos cuidado na preparação dos dados, maior o risco de um modelo “gabaritar” o treino e falhar na vida real. Por isso, o gabarito é a letra E, porque os três itens estão corretos. Em doutrina de aprendizado de máquina, essa relação entre bias, variância, ruído e generalização é clássica: underfitting costuma estar ligado a modelo pouco flexível, e overfitting, a modelo excessivamente ajustado aos dados observados.