← Questões de Banco de Dados

Banco de Dados · FGV · 2022

Questão comentada de Banco de Dados

O método random forests para classificação ou regressão potencializa alguns benefícios das árvores de decisão e por isso é preferido em certas situações. O uso de random forests seria vantajoso em relação à árvore de decisão no seguinte caso:

Gabarito: B

As random forests são um conjunto de árvores de decisão treinadas com amostras aleatórias dos dados e, em geral, com subconjuntos aleatórios de variáveis. A ideia é simples: em vez de confiar em uma única árvore, o modelo “faz uma votação” entre várias árvores, o que reduz a variância e deixa a previsão mais estável. Isso costuma melhorar muito o desempenho quando a árvore isolada tende a aprender demais os ruídos do conjunto de treino. Por isso, a principal vantagem das random forests aparece justamente em cenários com propensão ao overfitting. A árvore de decisão sozinha é famosa por ser instável e por se ajustar demais aos dados de treino, principalmente quando cresce muito. Já a random forest combate esse problema ao combinar várias árvores e suavizar decisões exageradas de uma única delas. Em prova, vale guardar a lógica do pacote: árvore de decisão é mais simples e interpretável, mas mais sujeita a overfitting; random forest é mais robusta e costuma generalizar melhor, porém perde interpretabilidade. Então, se a banca falar em reduzir overfitting, aumentar robustez e melhorar generalização, pense em random forest sem medo. O gabarito é a letra B porque o cenário descrito é exatamente o de um conjunto de dados com tendência a overfitting. Nesse caso, a random forest é vantajosa porque reduz a dependência de uma única árvore e melhora a capacidade de previsão em dados novos.

Continue treinando

Questões relacionadas