← Questões de Estatística

Estatística · FGV · 2022

Questão comentada de Estatística

Um problema comum no processamento de texto é o tratamento de termos compostos por mais de um token, tais como “Ministério Público”, tal que represente uma unidade linguística distinta, em particular na construção de modelos de linguagem. Considerando o problema acima descrito, a alternativa que apresenta uma técnica usada para sua resolução é:

Gabarito: D

Quando você trabalha com texto, nem toda unidade de sentido vem em uma única palavra. Expressões como "Ministério Público" ou "Banco Central" precisam ser tratadas como um bloco, porque, em muitos modelos de linguagem, o significado muda se você olhar só os tokens separados. É aí que entram os n-gramas: sequências de n tokens usadas para capturar combinações frequentes de palavras, ajudando o sistema a reconhecer essas expressões compostas. Na prática, isso evita que o modelo veja "Ministério" e "Público" como peças soltas sem relação. Com bigramas, por exemplo, a sequência "Ministério Público" pode ser registrada como uma unidade relevante, o que melhora tarefas como classificação de texto, busca e modelagem de linguagem. Em outras palavras: o texto deixa de parecer um quebra-cabeça desmontado e passa a ser lido com mais contexto. Por isso, o gabarito é a letra D. N-gramas são uma técnica clássica de processamento de linguagem natural para representar sequências de tokens e capturar termos compostos. As demais alternativas apontam para conceitos úteis em recuperação de informação ou representação semântica, mas não resolvem diretamente o problema descrito no enunciado. Não há um fundamento legal aqui, porque a questão é de Estatística aplicada e processamento de texto, mais especificamente de modelagem de linguagem e estatística descritiva de frequências em corpora.

Continue treinando

Questões relacionadas