A estagiária Mirella sabe que scikitlearn versão 1.6.1 oferece diversos algoritmos de aprendizado não supervisionado. No entanto, ela desconhece quais são os métodos de clusterização disponíveis no módulo sklearn.cluster. Assinale a opção que contém apenas os nomes dos métodos de clusterização disponíveis no módulo.
- A)Hdbscan e regressão logística.
Errada, porque Hdbscan não é o ponto esperado aqui e regressão logística é um método de classificação, não de clusterização.
- B)Mean-shift e naive bayes.
Errada, porque Mean-shift é de clusterização, mas naive Bayes é classificador probabilístico, não algoritmo de agrupamento.
- C)Perceptron e optics.
Errada, porque Perceptron é classificador supervisionado e OPTICS sim é de clusterização, então a alternativa mistura famílias diferentes.
- D)Birch e k-means.
Certa, porque Birch e K-Means são ambos métodos de clusterização do módulo sklearn.cluster.
- E)Dbscan e lasso.
Errada, porque DBSCAN é de clusterização, mas lasso é técnica de regressão/seleção de variáveis, não de agrupamento.
Gabarito: D
Em scikit-learn, o módulo sklearn.cluster reúne algoritmos de clusterização, isto é, técnicas de aprendizado não supervisionado que tentam agrupar dados por semelhança, sem rótulos prévios. Pense nele como o GPS do caos: ele não diz o nome do lugar, mas ajuda a separar quem anda junto de quem anda sozinho. Entre os métodos desse módulo estão, por exemplo, KMeans, DBSCAN, MeanShift, OPTICS, Birch e outros algoritmos voltados a formar grupos a partir da estrutura dos dados. O ponto central da questão é simples: a banca quer nomes de algoritmos de clusterização, não de classificadores ou regressão. Por isso, o gabarito é a letra D. Birch e K-Means são, de fato, métodos de clusterização disponíveis em sklearn.cluster. O Birch é útil para conjuntos grandes e o K-Means é o clássico que divide os dados em k grupos, sempre muito querido em prova porque aparece bastante e gera confusão com nomes parecidos. As demais alternativas misturam algoritmos de outras finalidades, como regressão logística, naive Bayes, perceptron e lasso, que não são clusterização. Em prova da FGV, essa mistura é a pegadinha favorita: ela joga dois nomes conhecidos para ver se você reconhece a família certa do algoritmo.