O analista de Business Intelligence Luiz está desenvolvendo uma solução aplicando técnicas de mineração de dados na base de dados de processos judiciais do MPU para descobrir padrões que mostrem resultados como o exemplificado a seguir. Para descobrir esse tipo de padrão, com antecedente e consequente, Luiz deve minerar:
- A)clusters;
Clusters servem para agrupar elementos parecidos, e não para identificar relações do tipo antecedente e consequente.
- B)outliers;
Outliers destacam observações muito diferentes do padrão, não regras de coocorrência entre variáveis.
- C)anomalias;
Anomalias são desvios incomuns do comportamento esperado, sem formar a estrutura de "se A, então B".
- D)regressões;
Regressão é usada para prever valores, geralmente numéricos, e não para minerar associações entre itens ou eventos.
- E)regras de associação.
Regras de associação descobrem padrões com antecedente e consequente, exatamente o tipo de relação pedido no enunciado.
Gabarito: E
Quando voce faz mineração de dados, cada técnica serve para achar um tipo de padrão. Se a ideia é encontrar relações do tipo "se acontecer A, então tende a acontecer B", voce está olhando para um padrão de coocorrência, muito comum em análise de cestas de compras, logs e bases processuais. Nesse caso, o resultado vem em forma de antecedente e consequente, exatamente como a questão descreve. Isso é o coração das regras de associação: descobrir itens, eventos ou características que aparecem juntos com frequência relevante. Em linguagem de BI, a técnica busca conexões do tipo "processos com tal característica têm maior chance de terminar de tal maneira". É por isso que o gabarito é a letra E. As métricas clássicas dessa técnica são suporte, confiança e lift. Elas ajudam a medir o quanto a regra é frequente, o quanto ela é confiável e se a associação é realmente interessante ou só coincidência estatística. Então, quando o enunciado fala em antecedente e consequente, pense sem medo: regra de associação na veia. As outras alternativas apontam para objetivos diferentes: clusterização agrupa semelhantes, outliers e anomalias destacam casos fora do padrão, e regressão tenta prever valores numéricos. Aqui não é previsão de número nem detecção de caso estranho, é descoberta de relacionamento entre eventos.