← Questões de Banco de Dados

Banco de Dados · FGV · 2023

Questão comentada de Banco de Dados

Uma das etapas mais importantes do processo de Mineração de Dados é o pré-processamento dos dados das fontes que, normalmente, apresentam diversos tipos de heterogeneidade. A operação de pré-processamento que transforma dados quantitativos (contínuos) em dados qualitativos, ou seja, atributos numéricos em atributos discretos ou nominais com um número finito de intervalos, obtendo uma partição não sobreposta de um domínio contínuo, é a:

Gabarito: D

No pré-processamento em Mineração de Dados, uma tarefa clássica é preparar a matéria-prima antes de jogar o algoritmo para trabalhar. Como os dados costumam vir bagunçados, com escalas diferentes, ruídos e formatos variados, é comum precisar transformar variáveis contínuas em faixas mais fáceis de analisar. Isso ajuda bastante quando você quer simplificar a interpretação ou adaptar os dados para certos modelos. A operação descrita no enunciado é a discretização: você pega valores numéricos contínuos e os converte em categorias ou intervalos finitos, como "baixo", "médio" e "alto", ou em classes de faixas numéricas. Em outras palavras, cria-se uma partição do domínio contínuo em intervalos que não se sobrepõem. É exatamente essa ideia que a questão pediu. Perceba que não é redução, porque redução de dados busca diminuir volume ou dimensionalidade, e não transformar tipo de atributo. Também não é imputação, que serve para tratar valores ausentes, nem técnicas de reamostragem como undersampling. Overfitting, então, é o vilão do modelo, não uma etapa de pré-processamento. Em suma: se a questão fala em converter contínuo em discreto/nominal por intervalos, pense em discretização.

Continue treinando

Questões relacionadas