No contexto de Descoberta do Conhecimento em Bancos de Dados - Knowledge Discovery in Database (KDD), o analista de dados João deverá analisar um conjunto de dados preparado e consolidado com dados financeiros sobre transações, saldos de contas e históricos de crédito de clientes ao longo dos últimos anos. O objetivo é identificar possíveis anomalias ou atividades suspeitas que possam indicar fraudes. Para isso, a fase do processo KDD que João deverá utilizar é:
- A)seleção de dados;
Errada, porque seleção de dados é a etapa de escolher quais dados farão parte do processo, não de descobrir anomalias ou fraudes.
- B)mineração de dados;
Certa, porque a mineração de dados é a fase do KDD em que se aplicam técnicas para encontrar padrões, desvios e indícios de fraude na base já preparada.
- C)transformação de dados;
Errada, porque transformação de dados serve para alterar formato, estrutura ou escala dos dados, e não para identificar suspeitas.
- D)interpretação de resultados;
Errada, porque interpretação de resultados ocorre depois da análise, quando os achados já foram produzidos e precisam ser avaliados.
- E)pré-processamento de dados.
Errada, porque pré-processamento é a etapa de limpeza e preparação dos dados, anterior à mineração propriamente dita.
Gabarito: B
No KDD, você pode pensar no processo como uma fila de etapas até chegar ao conhecimento útil: primeiro os dados são coletados e preparados, depois vêm as técnicas que realmente “garimpam” padrões escondidos. É nessa hora que o analista procura relações, clusters, regras, desvios e comportamentos fora do comum. Em outras palavras, é o momento de fazer a máquina trabalhar para revelar o que não aparece olhando a planilha de relance. No enunciado, João já tem um conjunto de dados preparado e consolidado, com informações financeiras ao longo de anos, e quer identificar anomalias ou atividades suspeitas que possam indicar fraudes. Isso é típico de mineração de dados, pois o objetivo é extrair padrões e descobrir conhecimento novo a partir de uma base já tratada. Em muitos livros de referência sobre KDD, a mineração de dados é justamente a fase central em que algoritmos são aplicados para encontrar padrões relevantes. As etapas anteriores, como seleção, pré-processamento e transformação, servem para deixar a base pronta. Mas quando a pergunta fala em identificar fraude, anomalia ou suspeita, ela está descrevendo uma tarefa analítica de descoberta de padrões, não apenas de organização dos dados. A fase adequada, portanto, é a mineração de dados. Resumo de prova: se a questão fala em “buscar padrões, anomalias, associações, classificação, previsão ou clusterização”, pense em mineração de dados. Se fala em limpar, selecionar, padronizar ou preparar a base, pense nas fases anteriores. Aqui, o gabarito B está correto porque a análise de suspeitas em dados já consolidados é exatamente o trabalho da etapa de mineração.