No campo da mineração de dados existem alguns problemas fundamentais que costumam aparecer com frequência em variados cenários de aplicação. O estudo desses problemas fornece ferramentas ao analista de dados que são aplicáveis em diferentes projetos de mineração de dados. Nesse conjunto se encontram os problemas de determinação de padrões, classificação de dados, segmentação de dados (clustering) e detecção de valores discrepantes (outliers). Considerando os problemas citados, analise as afirmativas a seguir. I. Em uma tabela binária esparsa, que representa uma base de dados de transações de clientes, em que as colunas representam cada produto e as linhas cada transação, verifica-se que, frequentemente, três das colunas apresentam simultaneamente o valor 1 para vários registros. Este tipo de análise é um problema de detecção de valores discrepantes. II. A identificação de consumidores que são similares entre si, para uso no contexto de aplicação de promoções orientadas, constitui um problema de segmentação de dados. III. O problema de classificação de dados pode ser considerado como supervisionado, pelo fato das relações entre as classes definidas e os demais atributos dos dados serem “aprendidas” pelo modelo. Está correto o que se afirma em
- A)I, apenas.
Errada, porque a afirmativa I está incorreta: coocorrência frequente de itens em transações remete a padrões frequentes, não a outliers.
- B)I e II, apenas.
Errada, porque a afirmativa I está errada, embora a II esteja correta ao associar consumidores semelhantes a clustering.
- C)I e III, apenas.
Errada, porque a afirmativa I não descreve detecção de discrepantes, mesmo que a III esteja certa ao tratar classificação como aprendizado supervisionado.
- D)II e III, apenas.
Certa, pois a II descreve clustering e a III define corretamente classificação como problema supervisionado.
- E)I, II e III.
Errada, porque a afirmativa I está incorreta ao confundir padrões frequentes com detecção de outliers.
Gabarito: D
Em mineração de dados, cada problema tem sua “função”. Clustering serve para agrupar objetos parecidos sem rótulos prévios; classificação, por sua vez, usa classes já conhecidas para treinar um modelo; detecção de outliers procura casos anormais ou muito diferentes do padrão; e a descoberta de padrões busca associações frequentes, como itens que aparecem juntos numa cesta de compras. É aquele quarteto clássico que a banca adora misturar para ver se você não troca alhos por bugalhos. Na afirmativa I, a descrição de uma tabela binária esparsa de transações, em que alguns produtos aparecem juntos com frequência, aponta para descoberta de padrões frequentes e regras de associação, não para outliers. Ou seja, encontrar itens que coocorrem muito é o oposto de procurar o estranho da turma. Na afirmativa II, identificar consumidores parecidos para ações promocionais é exatamente um caso de segmentação de dados, isto é, clustering. Você agrupa clientes com comportamentos semelhantes para tratar cada grupo de forma mais estratégica. Na afirmativa III, classificação é mesmo um problema supervisionado, porque o modelo aprende a relação entre atributos de entrada e classes conhecidas a partir de exemplos rotulados. Esse é o coração da classificação: aprender com respostas já dadas para prever a classe de novos casos. Portanto, a banca acerta ao considerar corretas apenas II e III, que levam à alternativa D.