Um conceito fundamental na modelagem probabilística de sequências de palavras é o de n-grama. Com relação a esse conceito, analise as afirmativas a seguir e assinale (V) para a verdadeira e (F) para a falsa. ( ) Um modelo bigrama assume a aproximação de que a probabilidade da próxima palavra em uma frase, considerando todas as palavras anteriores, é dada pela probabilidade condicional apenas da palavra imediatamente anterior. ( ) O modelo trigrama é também conhecido como modelo de Markov de terceira ordem. ( ) O cálculo de probabilidades em modelos n-grama é geralmente realizado utilizando logaritmos para evitar o fenômeno do underflow numérico. As afirmativas são, respectivamente,
- A)V – F – F.
Errada, porque a segunda afirmativa está incorreta e a terceira é verdadeira.
- B)V – V – F.
Errada, porque a segunda afirmativa não é verdadeira: trigrama não é Markov de terceira ordem.
- C)F – V – F.
Errada, porque a primeira afirmativa é verdadeira e a segunda também está errada.
- D)F – V – V.
Errada, porque a primeira afirmativa é verdadeira, então a sequência não pode começar com F.
- E)V – F – V.
Certa, pois a primeira e a terceira afirmativas são verdadeiras e a segunda é falsa.
Gabarito: E
N-grama é um jeito de modelar sequência de palavras olhando para um pedaço pequeno do contexto anterior, em vez de tentar carregar a frase inteira nas costas. No bigrama, a ideia é justamente aproximar a probabilidade da próxima palavra usando apenas a palavra imediatamente anterior. Isso é a suposição de Markov de primeira ordem, bem “curtinha” e prática. Já o trigrama usa duas palavras anteriores para prever a próxima, então ele é associado ao modelo de Markov de segunda ordem, e não de terceira. Aqui mora uma pegadinha clássica: o nome do n-grama conta quantas palavras entram no bloco, mas a ordem de Markov conta quantos estados anteriores são usados para prever o próximo passo. A terceira afirmativa também está correta: em modelos n-grama, o produto de muitas probabilidades pequenas pode ficar extremamente pequeno e causar underflow numérico. Por isso, é comum trabalhar com logaritmos, somando logs em vez de multiplicar probabilidades diretamente. Esse é um truque padrão em estatística computacional e processamento de linguagem natural. Assim, a sequência correta é V, F, V, que corresponde ao gabarito E.