O objetivo principal do uso de técnicas de Agrupamento (Clustering) em Análise de Dados é dividir um grande conjunto de dados em subconjuntos, agrupando elementos similares em categorias distintas. Assinale a opção que indica o tipo de algoritmo que não se enquadra nessa descrição.
- A)K-Means.
Correta, porque o K-Means é um algoritmo clássico de agrupamento que separa os dados em K clusters.
- B)Gaussian Mixture Models (GMM).
Correta, porque o GMM também é usado em clustering, modelando os dados como mistura de distribuições gaussianas.
- C)DBSCAN.
Correta, porque o DBSCAN é um algoritmo de clustering baseado em densidade, muito usado para detectar grupos e ruídos.
- D)K-Medoids.
Correta, porque o K-Medoids é uma técnica de agrupamento semelhante ao K-Means, mas baseada em medoids reais.
- E)Regressão Linear.
Errada, porque Regressão Linear não faz agrupamento; ela é usada para prever valores contínuos a partir de variáveis explicativas.
Gabarito: E
Clustering é uma técnica de aprendizado não supervisionado usada para separar dados em grupos com características parecidas. A ideia é simples: se alguns registros se comportam de forma semelhante, o algoritmo tenta colocá-los no mesmo “pacote”, sem que alguém diga previamente qual é o rótulo de cada um. Por isso, métodos como K-Means, K-Medoids, DBSCAN e GMM aparecem o tempo todo quando o assunto é agrupamento. O K-Means divide os pontos em K grupos com base na proximidade ao centróide, enquanto o K-Medoids faz algo parecido, mas usando um ponto real como referência do grupo. O DBSCAN agrupa por densidade, sendo útil para descobrir clusters com formatos mais irregulares. Já o Gaussian Mixture Models trabalha com a ideia de mistura de distribuições probabilísticas, também servindo para clustering. A Regressão Linear foge totalmente dessa lógica. Ela é uma técnica de aprendizado supervisionado voltada para prever um valor numérico contínuo, como preço, nota ou temperatura. Em vez de agrupar dados parecidos, ela tenta ajustar uma reta ou hiperplano para explicar a relação entre variáveis. Ou seja: aqui não tem “grupo”, tem previsão. Por isso, o gabarito é a letra E. Em prova, quando a banca fala em agrupamento, pense em técnicas de clusterização; quando fala em regressão, pense em predição de valores, não em formação de grupos.