Maria está preparando um relatório sobre as empresas de serviços de um município, de modo a identificar e estudar o porte dessas empresas com vistas ao estabelecimento de políticas públicas e previsões de arrecadação. Maria pretende criar nove grupos de empresas, de acordo com os valores de faturamento, e recorreu às técnicas usualmente empregadas em procedimentos de data mining para estabelecer as faixas de valores de cada grupo. Assinale a opção que apresenta a técnica diretamente aplicável a esse tipo de classificação.
- A)Algoritmos de associação.
Algoritmos de associação servem para descobrir relações do tipo “quem compra X também compra Y”, e não para formar grupos de empresas por faturamento.
- B)Algoritmos de clusterização.
Correta, porque a clusterização agrupa registros semelhantes sem rótulos prévios, exatamente o que se quer ao separar empresas em faixas de faturamento.
- C)Árvores de decisão.
Árvores de decisão são técnicas de classificação ou previsão com base em regras, não o método mais direto para criar agrupamentos por similaridade.
- D)Modelagem de dados.
Modelagem de dados trata da estruturação e representação dos dados, não de técnicas de data mining para segmentar empresas em grupos.
- E)Regressão linear.
Regressão linear estima uma variável numérica a partir de outras, mas não foi feita para dividir observações em grupos semelhantes.
Gabarito: B
Aqui a ideia é separar empresas em grupos com base em um atributo numérico, o faturamento, sem que exista uma classificação pronta dizendo qual empresa pertence a qual faixa. Esse é o cenário clássico de clusterização: você deixa os dados “se agruparem” por semelhança, e depois interpreta os grupos formados. Em outras palavras, Maria quer descobrir faixas naturais de faturamento para montar nove grupos, e isso combina muito mais com técnicas não supervisionadas do que com métodos de previsão ou regras prontas. A clusterização é usada justamente quando voce quer encontrar padrões, segmentações ou perfis dentro dos dados. Ela é muito comum em data mining para criar agrupamentos de clientes, empresas, municípios ou produtos com características parecidas. Aqui, a técnica trabalha bem porque a variável faturamento pode ser usada para dividir as empresas em faixas próximas, formando os nove grupos desejados. Por isso, o gabarito é a letra B. Não se trata de prever um valor futuro nem de descobrir uma relação do tipo “se acontecer X, então Y”. Trata-se de segmentar os registros em grupos semelhantes, o que é a cara da clusterização. Em termos de doutrina de mineração de dados, isso é aprendizado não supervisionado, em que o algoritmo busca estrutura nos dados sem rótulo prévio. As demais alternativas tentam confundir voce com técnicas de outro objetivo: associação busca regras entre itens, árvore de decisão classifica com base em regras e regressão estima valores, mas nenhuma delas é a ferramenta mais direta para criar grupos por semelhança de faturamento.