Um problema comum no processamento de texto é o tratamento de termos compostos por mais de um token, tais como “Ministério Público”, tal que represente uma unidade linguística distinta, em particular na construção de modelos de linguagem. Considerando o problema acima descrito, a alternativa que apresenta uma técnica usada para sua resolução é:
- A)representação por entidade;
Errada: representação por entidade é uma ideia mais ligada a reconhecimento de entidades nomeadas, não à técnica pedida para tratar sequências de tokens como unidade.
- B)índice invertido;
Errada: índice invertido ajuda a localizar termos em documentos, mas não é a técnica típica para unir termos compostos em um único bloco semântico.
- C)embedding;
Errada: embedding representa palavras ou textos em vetores num espaço contínuo, mas não é a solução específica para identificar expressões multi-token.
- D)representação por n-gramas;
Certa: n-gramas permitem considerar sequências de palavras como unidades, capturando termos compostos como "Ministério Público".
- E)decomposição morfológica.
Errada: decomposição morfológica trata a estrutura interna das palavras, não a composição de expressões formadas por vários tokens.
Gabarito: D
Quando você trabalha com texto, nem toda unidade de sentido vem em uma única palavra. Expressões como "Ministério Público" ou "Banco Central" precisam ser tratadas como um bloco, porque, em muitos modelos de linguagem, o significado muda se você olhar só os tokens separados. É aí que entram os n-gramas: sequências de n tokens usadas para capturar combinações frequentes de palavras, ajudando o sistema a reconhecer essas expressões compostas. Na prática, isso evita que o modelo veja "Ministério" e "Público" como peças soltas sem relação. Com bigramas, por exemplo, a sequência "Ministério Público" pode ser registrada como uma unidade relevante, o que melhora tarefas como classificação de texto, busca e modelagem de linguagem. Em outras palavras: o texto deixa de parecer um quebra-cabeça desmontado e passa a ser lido com mais contexto. Por isso, o gabarito é a letra D. N-gramas são uma técnica clássica de processamento de linguagem natural para representar sequências de tokens e capturar termos compostos. As demais alternativas apontam para conceitos úteis em recuperação de informação ou representação semântica, mas não resolvem diretamente o problema descrito no enunciado. Não há um fundamento legal aqui, porque a questão é de Estatística aplicada e processamento de texto, mais especificamente de modelagem de linguagem e estatística descritiva de frequências em corpora.