Assinale a opção que corresponde a métodos estatísticos que assumem distribuição ou modelo de probabilidade de dados, ou medidas de distância por meio das quais os objetos procurados são substancialmente distantes dos demais utilizados em data mining.
- A)associação
Errada, porque associação busca descobrir itens que aparecem juntos com frequência, e não identificar dados discrepantes.
- B)predição
Errada, porque predição serve para estimar valores futuros ou desconhecidos, não para localizar objetos anômalos em relação ao conjunto.
- C)detecção de anomalias
Certa, pois detecção de anomalias usa modelos probabilísticos ou medidas de distância para encontrar objetos muito diferentes dos demais.
- D)agrupamento
Errada, porque agrupamento procura reunir objetos parecidos em grupos, e não separar os que estão muito distantes como exceções.
Gabarito: C
Em data mining, algumas tarefas buscam encontrar padrões frequentes ou relações entre variáveis, enquanto outras procuram prever um valor futuro, formar grupos semelhantes ou achar pontos que fogem completamente do padrão. A questão descreve um método estatístico que usa distribuição de probabilidade ou medidas de distância para localizar objetos que estão substancialmente distantes dos demais. Isso é a cara da detecção de anomalias: em vez de olhar para o comportamento típico, você procura o que destoa dele. Pense assim: se a base tem um padrão normal, o interessante aqui é justamente o aluno que tirou nota muito diferente de todo mundo, a transação estranha no cartão ou o sensor que começou a se comportar como se tivesse tomado café demais. Esses casos não são o centro da análise, e sim os sinais de alerta. Por isso, a ideia de distância e de probabilidade aparece muito nesse tema. As técnicas de anomalia podem usar modelos probabilísticos, assumindo que os dados seguem certa distribuição, ou métricas de distância, marcando como suspeitos os objetos muito afastados do conjunto principal. É exatamente essa formulação que o enunciado trouxe. Então, o gabarito está correto ao apontar a detecção de anomalias. Já associação, predição e agrupamento pertencem a outras finalidades de data mining. Elas são importantes, mas não têm como foco principal localizar elementos que fogem do padrão com base em distanciamento ou improbabilidade. Aqui, a banca quer que você reconheça a pista técnica escondida no enunciado: "substancialmente distantes dos demais" é quase um neon piscando para anomalias.