Em um problema de classificação é entregue ao cientista de dados um par de covariáveis, (x1 , x2 ), para cada uma das quatro observações a seguir: (6,4), (2,8), (10,6) e (5,2). A variável resposta observada nessa amostra foi “Sim”, “Não”, “Sim”, “Não”, respectivamente. A partição que apresenta o menor erro de classificação quando feita na raiz (primeiro nível) de uma árvore de decisão é:
- A)x1 > 2 (“Sim”) e x1 ≤ 2 (“Não”);
Errada, porque o corte em x1 > 2 ainda mistura “Sim” e “Não” em pelo menos um dos lados.
- B)x1 > 5 (“Sim”) e x1 ≤ 5 (“Não”);
Certa, porque o corte em x1 > 5 separa perfeitamente os “Sim” dos “Não”, gerando erro zero na raiz.
- C)x2 > 3 (“Sim”) e x2 ≤ 3 (“Não”);
Errada, porque x2 > 3 não isola as classes sem mistura nos dois grupos.
- D)x2 > 6 (“Sim”) e x2 ≤ 6 (“Não”);
Errada, porque x2 > 6 deixa observações de classes diferentes no mesmo lado do corte.
- E)x1 > 1 (“Sim”) e x1 ≤ 1 (“Não”).
Errada, porque x1 > 1 praticamente não separa a amostra e mantém as classes misturadas.
Gabarito: B
Em árvore de decisão, a ideia na raiz é escolher a divisão que separa melhor os dados logo de cara. Para isso, você testa cortes possíveis em uma variável e mede o erro de classificação em cada lado. Em linguagem simples: cada partição tenta deixar um lado mais “Sim” e o outro mais “Não”, com o menor número de trocas possíveis. Aqui, os dados têm dois pontos “Sim” com x1 maior e dois pontos “Não” com x1 menor. Quando você corta em x1 > 5, os dois pontos com x1 acima de 5 são exatamente “Sim” e os dois com x1 menor ou igual a 5 são exatamente “Não”. Resultado: erro de classificação zero na raiz, que é o melhor cenário possível. As outras opções misturam as classes em pelo menos um dos lados do corte, então sempre sobra algum ponto do “lado errado”. Em árvore de decisão, isso pesa bastante, porque a raiz é o primeiro filtro da história: quanto mais limpa a separação ali, melhor a árvore começa. Por isso o gabarito é a alternativa B. Ela cria uma partição perfeita com os quatro dados da amostra, sem erro de classificação no primeiro nível.