Um analista precisa construir um modelo de tópicos para uma grande base de documentos legais, mas há uma preocupação quanto à interpretabilidade do modelo e à capacidade de inspecionar os resultados. Considerando essa preocupação, a técnica mais apropriada para a construção do modelo e a razão da escolha são, respectivamente:
- A)Latent Semantic Analysis, devido à distância média dos tópicos gerados;
Errada: LSA usa decomposição matricial, mas não é a melhor resposta quando a preocupação principal é interpretabilidade e inspeção clara dos tópicos.
- B)Latent Dirichlet Allocation, devido à capacidade de capturar informação sintática em sua representação;
Errada: LDA é um modelo probabilístico de tópicos, mas não é conhecido por capturar informação sintática na representação.
- C)Non-Negative Matrix Factorization, devido à representação esparsa e estritamente não negativa;
Certa: a NMF gera fatores esparsos e estritamente não negativos, o que melhora bastante a interpretabilidade dos tópicos.
- D)Explicit Semantic Analysis, devido à possibilidade de definir explicitamente tópicos a priori;
Errada: ESA trabalha com conceitos explicitamente definidos, mas não é a técnica mais adequada para construir esse modelo de tópicos nesta situação.
- E)Parallel Latent Dirichlet Allocation, devido à distância mínima dos tópicos gerados.
Errada: Parallel LDA é uma variação de implementação/escalabilidade do LDA, sem relação com a ideia de distância mínima dos tópicos.
Gabarito: C
Quando a meta é montar um modelo de tópicos para muitos documentos e, ao mesmo tempo, conseguir entender e inspecionar o resultado sem sofrer, a escolha costuma favorecer técnicas mais transparentes. Em mineração de texto, isso importa muito em bases legais, porque você quer enxergar quais palavras pesam em cada tópico e interpretar cada grupo com clareza, sem virar uma caixa-preta. A pista principal da questão é a interpretabilidade. O modelo precisa permitir leitura humana dos tópicos, com pesos que façam sentido e sejam fáceis de examinar. A técnica que melhor combina com isso é a Non-Negative Matrix Factorization, pois ela decompõe a matriz termo-documento em fatores com valores sempre não negativos. Isso ajuda bastante na interpretação, porque não existem cancelamentos estranhos entre valores positivos e negativos, e os tópicos tendem a ficar mais claros e esparsos. Em termos práticos, essa representação estritamente não negativa facilita ver quais termos realmente compõem cada tópico. É como organizar a gaveta sem misturar roupa com líquido: fica bem mais fácil inspecionar o conteúdo. Por isso, em tarefas em que explicabilidade e análise manual importam, a NMF costuma ser preferida. Já o LDA é famoso em modelagem de tópicos, mas é probabilístico e não é escolhido aqui por capturar informação sintática. A base da ideia nele é a distribuição de palavras e tópicos, não a sintaxe. Então, o gabarito C está correto porque a NMF oferece uma representação esparsa e não negativa, o que favorece muito a interpretabilidade e a inspeção dos resultados.