Sobre a divisão e tratamento de dados, assinale a afirmativa correta.
- A)Os dados coletados podem ser de três tipos: numéricos, texto e imagem; assim, os algoritmos de aprendizagem de máquina são capazes de lidar com todos os tipos de dados, bastando que os dados sejam transformados para dados contínuos utilizando técnicas como interpolação.
Errada, porque nem todo dado precisa virar dado contínuo para ser usado em aprendizado de máquina, e interpolação não é uma solução universal para todos os tipos de dados.
- B)Média da coluna, interpolação de vizinhos mais próximos, moda da coluna, vizinhos mais próximos (KNN) e valor aleatório são métodos para tratamento de dados faltantes, ou seja, atributos não preenchidos na base de dados.
Certa, porque média, moda, KNN, vizinhos mais próximos e valor aleatório são métodos usados para tratamento de dados faltantes.
- C)Validação cruzada é um método de divisão dos dados em que os dados são divididos por k partes em que, a cada rodada, uma das partes é o conjunto de teste e o restante é utilizado para treino; a divisão dos conjuntos estratificada para validação cruzada não é aconselhada caso o valor de k seja igual a 10.
Errada, porque validação cruzada com estratificação pode ser usada mesmo com k=10, e essa afirmação sobre não ser aconselhada não procede.
- D)O método de divisão de dados leave-one-out (deixando um de fora) aproveita o máximo dos dados, pois todos os dados, com exceção de um item, são utilizados para treinar a cada execução; essa configuração é a mais utilizada para algoritmos custosos de aprendizado de máquina como as redes neurais profundas.
Errada, porque leave-one-out realmente usa todos os dados menos um para treino, mas não é a configuração mais usada em algoritmos custosos como redes neurais profundas, já que exige muito processamento.
- E)A divisão dos dados em 3 conjuntos (treino, validação e teste) é bastante comum para avaliação de algoritmos com muitos parâmetros, como as redes neurais; o conjunto de validação funciona como um conjunto de avaliação de parâmetros e é utilizado para confirmar se o algoritmo encontrou o máximo global.
Errada, porque o conjunto de validação serve para ajuste e seleção de parâmetros, mas não confirma a existência de máximo global do algoritmo.
Gabarito: B
Quando você trabalha com dados para treino e avaliação de modelos, a primeira preocupação é separar bem as amostras para não “ensinar e testar na mesma prova”. Por isso existem técnicas como divisão simples em treino, validação e teste, além da validação cruzada, que repete esse processo em várias partições para dar uma estimativa mais estável do desempenho. Outro ponto importante é tratar os dados faltantes. Em bases reais, é comum haver campos vazios, e aí entram estratégias como preencher pela média, pela moda, por um valor aleatório, por vizinhos próximos ou até por métodos mais sofisticados, como KNN. A ideia é reduzir o impacto das lacunas sem distorcer demais a base. A alternativa B está correta porque lista justamente métodos conhecidos de imputação de dados faltantes: média da coluna, moda, uso de vizinhos mais próximos e preenchimento aleatório. A interpolação também aparece como técnica de estimativa em certos contextos de dados, especialmente quando há uma ordem natural nas observações. As demais alternativas erram por generalizações ou por confundir conceitos. Validação cruzada, leave-one-out e a divisão treino-validação-teste são assuntos clássicos, mas a redação traz distorções sobre quando cada uma é usada e sobre o papel da validação. Em concurso, a banca adora trocar um detalhe técnico por outro que parece plausível, então vale ler com lupa.