O método random forests para classificação ou regressão potencializa alguns benefícios das árvores de decisão e por isso é preferido em certas situações. O uso de random forests seria vantajoso em relação à árvore de decisão no seguinte caso:
- A)redução do custo computacional;
Errada, porque random forests geralmente aumentam o custo computacional em relação a uma única árvore de decisão, já que precisam treinar e combinar várias árvores.
- B)conjunto de dados com propensão à overfitting;
Certa, porque a random forest é indicada quando há risco de overfitting, pois o conjunto de árvores reduz a variância e melhora a generalização.
- C)melhor interpretabilidade do modelo;
Errada, porque a interpretabilidade é uma vantagem da árvore de decisão, enquanto a random forest é bem menos transparente.
- D)conjunto de dados muito pequeno;
Errada, porque em bases muito pequenas a random forest pode até piorar a estabilidade, e não é o cenário mais favorável para esse método.
- E)número elevado de classes.
Errada, porque o número de classes não é a principal vantagem da random forest; ela pode lidar com várias classes, mas isso não é o diferencial central em relação à árvore isolada.
Gabarito: B
As random forests são um conjunto de árvores de decisão treinadas com amostras aleatórias dos dados e, em geral, com subconjuntos aleatórios de variáveis. A ideia é simples: em vez de confiar em uma única árvore, o modelo “faz uma votação” entre várias árvores, o que reduz a variância e deixa a previsão mais estável. Isso costuma melhorar muito o desempenho quando a árvore isolada tende a aprender demais os ruídos do conjunto de treino. Por isso, a principal vantagem das random forests aparece justamente em cenários com propensão ao overfitting. A árvore de decisão sozinha é famosa por ser instável e por se ajustar demais aos dados de treino, principalmente quando cresce muito. Já a random forest combate esse problema ao combinar várias árvores e suavizar decisões exageradas de uma única delas. Em prova, vale guardar a lógica do pacote: árvore de decisão é mais simples e interpretável, mas mais sujeita a overfitting; random forest é mais robusta e costuma generalizar melhor, porém perde interpretabilidade. Então, se a banca falar em reduzir overfitting, aumentar robustez e melhorar generalização, pense em random forest sem medo. O gabarito é a letra B porque o cenário descrito é exatamente o de um conjunto de dados com tendência a overfitting. Nesse caso, a random forest é vantajosa porque reduz a dependência de uma única árvore e melhora a capacidade de previsão em dados novos.