Um servidor público de um órgão previdenciário, após analisar um conjunto de dados sobre benefícios concedidos, percebeu uma ampla variação nos valores e nas características dos beneficiários. Para organizar melhor essas informações, ele precisa agrupar os beneficiários conforme seus perfis, permitindo uma análise mais precisa e a implementação de políticas específicas para cada grupo. Assinale a opção que contém o algoritmo mais apropriado para realizar a tarefa acima.
- A)Dijkstra.
Dijkstra é um algoritmo de caminho mínimo em grafos, sem relação com agrupamento de dados.
- B)PCA.
PCA reduz a dimensionalidade e resume variáveis, mas não serve para formar grupos de observações.
- C)LSTM.
LSTM é uma rede neural usada principalmente em sequências e séries temporais, não em clusterização clássica.
- D)K-means.
K-means é um algoritmo de agrupamento que separa observações em clusters conforme semelhança.
- E)ARIMA.
ARIMA é um modelo para previsão de séries temporais, e não para segmentar beneficiários em grupos.
Gabarito: D
A questão fala em agrupar beneficiários conforme perfis parecidos, ou seja, em formar grupos dentro do conjunto de dados. Isso é exatamente o tipo de tarefa feita por algoritmos de clusterização, que buscam reunir observações semelhantes sem precisar de rótulo prévio. Pense neles como um organizador de arquivos: em vez de misturar todo mundo na mesma gaveta, ele separa por semelhança. O algoritmo mais conhecido para isso é o K-means. Ele divide os dados em k grupos, tentando deixar os elementos de cada grupo o mais próximos possível entre si e o mais diferentes possível dos outros grupos. Em termos práticos, ajuda a enxergar padrões em bases grandes e heterogêneas, como perfis de beneficiários, clientes ou pacientes. Por isso, o gabarito é a letra D. A ideia central do enunciado não é prever valores, reduzir dimensões ou ordenar caminhos, mas sim segmentar a base em grupos com características semelhantes. Em Estatística multivariada, isso é clássico de análise de agrupamentos. Não há aqui uma pegadinha jurídica ou normativa relevante, porque a questão é puramente metodológica. O ponto é reconhecer a finalidade do algoritmo: clustering, e não regressão, séries temporais ou redes neurais.