Uma das etapas mais importantes do processo de Mineração de Dados é o pré-processamento dos dados das fontes que, normalmente, apresentam diversos tipos de heterogeneidade. A operação de pré-processamento que transforma dados quantitativos (contínuos) em dados qualitativos, ou seja, atributos numéricos em atributos discretos ou nominais com um número finito de intervalos, obtendo uma partição não sobreposta de um domínio contínuo, é a:
- A)Redução;
Errada, porque redução de dados diminui volume ou dimensionalidade, mas não converte atributos numéricos contínuos em categorias.
- B)Imputação;
Errada, porque imputação trata valores faltantes, não faz a transformação de variáveis contínuas em intervalos discretos.
- C)Overfitting;
Errada, porque overfitting é um problema de ajuste excessivo do modelo, e não uma técnica de pré-processamento.
- D)Discretização;
Certa, porque discretização transforma dados quantitativos contínuos em atributos discretos ou nominais por meio de intervalos finitos.
- E)Undersampling.
Errada, porque undersampling é uma técnica de balanceamento de classes por redução de amostras, não de transformação de tipo de atributo.
Gabarito: D
No pré-processamento em Mineração de Dados, uma tarefa clássica é preparar a matéria-prima antes de jogar o algoritmo para trabalhar. Como os dados costumam vir bagunçados, com escalas diferentes, ruídos e formatos variados, é comum precisar transformar variáveis contínuas em faixas mais fáceis de analisar. Isso ajuda bastante quando você quer simplificar a interpretação ou adaptar os dados para certos modelos. A operação descrita no enunciado é a discretização: você pega valores numéricos contínuos e os converte em categorias ou intervalos finitos, como "baixo", "médio" e "alto", ou em classes de faixas numéricas. Em outras palavras, cria-se uma partição do domínio contínuo em intervalos que não se sobrepõem. É exatamente essa ideia que a questão pediu. Perceba que não é redução, porque redução de dados busca diminuir volume ou dimensionalidade, e não transformar tipo de atributo. Também não é imputação, que serve para tratar valores ausentes, nem técnicas de reamostragem como undersampling. Overfitting, então, é o vilão do modelo, não uma etapa de pré-processamento. Em suma: se a questão fala em converter contínuo em discreto/nominal por intervalos, pense em discretização.