← Questões de Banco de Dados

Banco de Dados · FGV · 2022

Questão comentada de Banco de Dados

Um analista do TCU gostaria de aplicar um modelo de Latent Dirichlet Allocation (LDA) em um conjunto de textos. A alternativa que melhor descreve o resultado do modelo é:

Gabarito: E

O LDA (Latent Dirichlet Allocation) é um modelo probabilístico de tópicos: ele tenta descobrir, sozinho, quais assuntos aparecem em um conjunto de textos. A ideia central é simples e elegante: cada documento não pertence a um único tópico, mas mistura vários tópicos em proporções diferentes. Pense em uma receita com vários ingredientes - o documento tem um pouco de cada tema, em vez de ficar preso a uma caixa só. No modelo, cada tópico é representado por uma distribuição de probabilidade sobre as palavras do vocabulário. Ou seja, um tópico de "saúde" tende a dar mais peso a palavras como hospital, médico e paciente, enquanto um tópico de "economia" puxa para mercado, inflação e juros. Não existe, portanto, um título fixo e oficial do tópico; o nome costuma ser interpretado depois, pelo analista. A alternativa E está correta porque descreve exatamente essa lógica: cada documento possui uma distribuição de probabilidade entre os tópicos, e cada tópico possui uma distribuição de probabilidade sobre as palavras. Isso é a essência do LDA, um modelo generativo de mistura de tópicos, muito usado em mineração de textos e processamento de linguagem natural. O ponto que costuma confundir é achar que o documento fica em apenas um tópico ou que cada palavra pertence a um único tópico. No LDA, a mistura é probabilística e flexível, não é classificação rígida. É um modelo de "pouquinho de tudo", não de "uma coisa só".

Continue treinando

Questões relacionadas