Durante a elaboração de um sistema de busca de informações biomédicas, foi construído um modelo de linguagem vetorial não contextual para estimar relações de similaridade semântica necessárias para comparação entre queries e documentos. Entretanto, verificou-se nos testes iniciais que o desempenho do modelo ficou insatisfatório, devido a muitos termos técnicos presentes nos documentos testados, que não haviam sido incorporados ao modelo. Para aliviar esse problema, uma tarefa de processamento do texto e seu estágio correspondente no processamento de linguagem natural que poderiam ser aplicados na construção do modelo são, respectivamente:
- A)Word embedding; Análise léxica;
Errada, porque word embedding nao e tarefa de processamento do texto, e analise lexica nao resolve o problema de termos tecnicos desconhecidos por si so.
- B)Lematização; Análise sintática;
Errada, porque lematizacao reduz flexoes para a forma base, mas analise sintatica trata estrutura frasal, nao a fragmentacao de termos novos.
- C)Decomposição morfológica; Análise léxica;
Certa, pois a decomposicao morfologica ajuda a lidar com palavras tecnicas desconhecidas e a analise lexica e a etapa inicial adequada no processamento do texto.
- D)Word embedding; Análise semântica;
Errada, porque word embedding e um tipo de representacao vetorial, nao uma tarefa de processamento do texto, e analise semantica e posterior ao tratamento lexical.
- E)Decomposição morfológica; Análise sintática.
Errada, porque decomposicao morfologica ate faz sentido para lidar com termos novos, mas analise sintatica nao e o estagio correspondente mais adequado.
Gabarito: C
Quando voce trabalha com texto tecnico, um problema classico e o vocabulário fora do modelo: aparecem termos novos, siglas e palavras muito especificas que o sistema nao conhece bem. Para reduzir esse sufoco, uma estrategia e decompor as palavras em unidades menores, como radicais, prefixos e sufixos, porque isso ajuda o modelo a capturar partes recorrentes dos termos mesmo quando a palavra inteira nao estava no treino. Em linguagem natural, isso se conecta ao processamento no nivel da forma das palavras, isto e, ao trabalho mais inicial com o texto, antes de entrar em analise de sentido profundo. E por isso que o gabarito e a alternativa C. A decomposicao morfologica trata a estrutura interna das palavras e ajuda a lidar com variacoes terminologicas e palavras desconhecidas. Ja a analise lexica e a etapa que lida com a identificacao e classificacao das unidades basicas do texto, como palavras e simbolos, o que combina com esse tipo de preparacao para montar o modelo vetorial. O erro mais comum aqui e confundir etapas do PLN. Analise sintatica olha a organizacao das frases e relacoes gramaticais, enquanto analise semantica tenta entender o significado. Nenhuma das duas resolve diretamente o problema de termos tecnicos novos no vocabulário do modelo. Em questoes assim, a banca gosta de testar se voce sabe separar o nivel da palavra do nivel da frase. Em resumo: para melhorar a representacao de termos biomedicos desconhecidos, faz sentido quebrar as palavras em partes menores e tratar isso na etapa inicial do processamento do texto.