Um analista do TCU gostaria de aplicar um modelo de Latent Dirichlet Allocation (LDA) em um conjunto de textos. A alternativa que melhor descreve o resultado do modelo é:
- A)uma lista de tópicos, cada um com um título diferente;
Errada, porque o LDA não entrega tópicos com títulos prontos; os rótulos dos tópicos são interpretados depois pelo analista.
- B)uma lista das palavras mais importantes no conjunto de documentos;
Errada, porque isso descreve mais uma contagem ou extração de termos relevantes, e não a modelagem probabilística de tópicos do LDA.
- C)cada documento é classificado em somente um tópico, onde cada tópico é formado por uma lista de palavras;
Errada, porque o LDA não classifica cada documento em um único tópico, mas em uma mistura de tópicos com probabilidades diferentes.
- D)cada documento possui uma distribuição de probabilidade de pertencer a algum dos tópicos, onde cada tópico é formado por uma lista de palavras e cada palavra pertence a somente um tópico;
Errada, porque o LDA não impõe que cada palavra pertença a somente um tópico; a palavra é tratada dentro de uma distribuição probabilística do tópico.
- E)cada documento possui uma distribuição de probabilidade de pertencer a algum dos tópicos, onde cada tópico é formado por uma distribuição de probabilidade sobre todas as palavras presentes nos documentos.
Certa, porque o LDA modela cada documento como uma distribuição sobre tópicos e cada tópico como uma distribuição sobre palavras.
Gabarito: E
O LDA (Latent Dirichlet Allocation) é um modelo probabilístico de tópicos: ele tenta descobrir, sozinho, quais assuntos aparecem em um conjunto de textos. A ideia central é simples e elegante: cada documento não pertence a um único tópico, mas mistura vários tópicos em proporções diferentes. Pense em uma receita com vários ingredientes - o documento tem um pouco de cada tema, em vez de ficar preso a uma caixa só. No modelo, cada tópico é representado por uma distribuição de probabilidade sobre as palavras do vocabulário. Ou seja, um tópico de "saúde" tende a dar mais peso a palavras como hospital, médico e paciente, enquanto um tópico de "economia" puxa para mercado, inflação e juros. Não existe, portanto, um título fixo e oficial do tópico; o nome costuma ser interpretado depois, pelo analista. A alternativa E está correta porque descreve exatamente essa lógica: cada documento possui uma distribuição de probabilidade entre os tópicos, e cada tópico possui uma distribuição de probabilidade sobre as palavras. Isso é a essência do LDA, um modelo generativo de mistura de tópicos, muito usado em mineração de textos e processamento de linguagem natural. O ponto que costuma confundir é achar que o documento fica em apenas um tópico ou que cada palavra pertence a um único tópico. No LDA, a mistura é probabilística e flexível, não é classificação rígida. É um modelo de "pouquinho de tudo", não de "uma coisa só".