← Questões de Estatística

Estatística · FGV · 2025

Questão comentada de Estatística

Um conceito fundamental na modelagem probabilística de sequências de palavras é o de n-grama. Com relação a esse conceito, analise as afirmativas a seguir e assinale (V) para a verdadeira e (F) para a falsa. ( ) Um modelo bigrama assume a aproximação de que a probabilidade da próxima palavra em uma frase, considerando todas as palavras anteriores, é dada pela probabilidade condicional apenas da palavra imediatamente anterior. ( ) O modelo trigrama é também conhecido como modelo de Markov de terceira ordem. ( ) O cálculo de probabilidades em modelos n-grama é geralmente realizado utilizando logaritmos para evitar o fenômeno do underflow numérico. As afirmativas são, respectivamente,

Gabarito: E

N-grama é um jeito de modelar sequência de palavras olhando para um pedaço pequeno do contexto anterior, em vez de tentar carregar a frase inteira nas costas. No bigrama, a ideia é justamente aproximar a probabilidade da próxima palavra usando apenas a palavra imediatamente anterior. Isso é a suposição de Markov de primeira ordem, bem “curtinha” e prática. Já o trigrama usa duas palavras anteriores para prever a próxima, então ele é associado ao modelo de Markov de segunda ordem, e não de terceira. Aqui mora uma pegadinha clássica: o nome do n-grama conta quantas palavras entram no bloco, mas a ordem de Markov conta quantos estados anteriores são usados para prever o próximo passo. A terceira afirmativa também está correta: em modelos n-grama, o produto de muitas probabilidades pequenas pode ficar extremamente pequeno e causar underflow numérico. Por isso, é comum trabalhar com logaritmos, somando logs em vez de multiplicar probabilidades diretamente. Esse é um truque padrão em estatística computacional e processamento de linguagem natural. Assim, a sequência correta é V, F, V, que corresponde ao gabarito E.

Continue treinando

Questões relacionadas