Maria está construindo um sistema de aprendizado de máquina que utiliza a informação sobre a segmentação de clientes que está armazenada no CRM da empresa. Porém, a segmentação que ela extrai do CRM possui os valores "bronze", "prata" e "ouro", que seu sistema não entende. Para isso, Maria quer implementar um processo de ETL que recodifica a segmentação para os valores "0", "1" e "2" representando, respectivamente, "bronze", "prata" e "ouro" antes de carregar os dados em seu sistema. O tipo de transformação que Maria deve empregar em seu processo ETL é
- A)deduplication.
Errada, porque deduplication serve para eliminar registros repetidos, e não para recodificar valores de um campo.
- B)filtering.
Errada, porque filtering apenas filtra linhas com base em critérios, sem trocar "bronze", "prata" e "ouro" por códigos.
- C)join.
Errada, porque join combina dados de diferentes tabelas, e a questão fala só de converter valores de uma mesma informação.
- D)mapping.
Certa, porque mapping faz a correspondência entre valores de origem e valores de destino, exatamente como na recodificação proposta.
- E)sorting.
Errada, porque sorting organiza os dados em ordem, mas não altera os rótulos da segmentação.
Gabarito: D
Em ETL, a etapa de transformação serve para pegar os dados brutos e deixá-los no formato que o sistema de destino entende. Isso inclui padronizar códigos, converter tipos, tratar valores e recodificar campos. Ou seja, não basta extrair e empurrar os dados para dentro do sistema: antes, eles precisam falar a mesma língua. No caso da questão, Maria quer trocar os rótulos "bronze", "prata" e "ouro" por "0", "1" e "2". Isso é um exemplo clássico de mapeamento de valores, também chamado de recodificação ou codificação de categorias. Você pega um valor de origem e o associa a outro valor de destino de forma direta. Por isso, o gabarito é a letra D, mapping. Em termos práticos, é como fazer uma tradução de dicionário: um termo entra, outro sai. Esse tipo de transformação é muito comum em preparação de dados para machine learning, porque muitos algoritmos precisam de entradas numéricas ou padronizadas. As outras alternativas tratam de operações diferentes: deduplication remove duplicidades, filtering seleciona apenas alguns registros, join combina tabelas e sorting ordena dados. Aqui não há eliminação, seleção, junção ou ordenação, mas sim substituição de categorias por códigos.