Sobre a função train_test_split() da biblioteca scikit-learn, no contexto de aprendizado de máquina em Python, assinale a afirmativa INCORRETA.
- A)Oferece a opção de embaralhar os dados antes da divisão por meio do parâmetro shuffle.
Certa, porque o parâmetro shuffle controla se os dados serão embaralhados antes da divisão.
- B)Permite definir a semente do gerador de números aleatórios com o parâmetro random_state.
Certa, porque random_state define a semente e torna a divisão reprodutível.
- C)Pode preservar a proporção de classes em problemas de classificação usando o parâmetro stratify.
Certa, porque stratify ajuda a preservar a proporção das classes ao separar os dados.
- D)Permite configurar a proporção dos subconjuntos através do parâmetro test_size, o qual aceita valores entre 0 e 1
Certa, porque test_size define o tamanho da parte reservada ao teste, geralmente como fração entre 0 e 1.
- E)É capaz de dividir o conjunto de dados em múltiplos subconjuntos, retornando dados de treino, dados de teste e validação, simultaneamente.
Errada, porque train_test_split() não divide automaticamente em treino, teste e validação ao mesmo tempo.
Gabarito: E
A função train_test_split(), do scikit-learn, é uma ferramenta clássica para separar dados em treino e teste de forma prática. Ela costuma ser usada logo no começo do fluxo de aprendizado de máquina, porque você precisa treinar o modelo em uma parte dos dados e depois avaliar em outra que ele ainda não viu. Parece simples, mas é exatamente aí que mora a prova: saber o que ela faz de verdade e o que ela não faz. Ela permite embaralhar os dados com shuffle, definir aleatoriedade com random_state, e até manter a proporção das classes com stratify, o que é bem útil em problemas de classificação. Também aceita test_size para indicar a fração destinada ao teste, normalmente entre 0 e 1 quando a divisão é proporcional, embora também possa receber um inteiro em alguns casos. Ou seja, é uma função de divisão, não de mágica. O ponto central da questão está na alternativa E. A train_test_split() não cria, por si só, três subconjuntos separados em treino, teste e validação simultaneamente. Ela foi desenhada para dividir os dados em partes, tipicamente treino e teste, e se você quiser validação, precisa montar isso com outra estratégia, como nova divisão ou uso de validação cruzada. Em termos de biblioteca, a função retorna subconjuntos de acordo com os arrays passados, mas não gera automaticamente um conjunto de validação independente.