No contexto de pré-processamento de dados, o auditor de contas públicas João está trabalhando em um projeto de análise de dados e percebe que as variáveis numéricas no conjunto de dados têm escalas muito diferentes, como a escala dos preços sendo maior do que a escala dos pesos, como demonstrado nos produtos A e B: • Produto A (Preço: R$ 50 e Peso: 300g) • Produto B (Preço: R$ 500 e Peso: 1000g) Além disso, ele observa a presença de outliers nos dados. Nesse sentido, João deverá tratar os dados para garantir que as variáveis tenham uma distribuição normal, isto é, com média igual a zero e desvio padrão igual a um. Para isso, a técnica de tratamento de dados que João deverá utilizar, levando em consideração a presença de outliers, é:
- A)discretização (kbins discretization);
Errada, porque discretização transforma valores contínuos em faixas/categorias, não produz média 0 e desvio padrão 1.
- B)codificação (one-hot encoding);
Errada, porque one-hot encoding é usado para variáveis categóricas, não para ajustar escalas de variáveis numéricas.
- C)normalização (min-max scaling);
Errada, porque a normalização min-max apenas reescala os dados, geralmente para o intervalo 0 a 1, e é mais sensível a outliers.
- D)padronização (standardization Z-Score);
Certa, porque a padronização Z-Score centraliza os dados na média 0 e ajusta o desvio padrão para 1.
- E)transformação logarítmica (log transformation).
Errada, porque a transformação logarítmica ajuda a reduzir assimetria e o impacto de valores altos, mas não garante média 0 e desvio padrão 1.
Gabarito: D
Em resumo: o objetivo era equalizar escalas e gerar uma transformação compatível com distribuição padronizada. Por isso, o gabarito correto é a letra D. A ideia é clássica em ciência de dados e estatística aplicada: padronizar quando você quer comparar variáveis em escalas diferentes e não quer que a unidade de medida bagunce a análise.