← Questões de Estatística

Estatística · FGV · 2022

Questão comentada de Estatística

A atividade de classificação de documentos envolve um grande número de tarefas de processamento de linguagem natural, o que pode levar a dúvidas quanto a sua aplicação. A alternativa que contém apenas tarefas que sejam exemplos de classificação de documentos é:

Gabarito: C

A questão cobra a ideia de tarefas de processamento de linguagem natural que realmente funcionam como classificacao de documentos, ou seja, quando o sistema atribui um rotulo a um texto. Pense em rotulos como “spam”, “positivo/negativo”, “tema X/Y” ou “idioma A/B”. Nesses casos, o objetivo nao e desmontar o texto palavra por palavra, mas decidir em qual classe ele entra. A analise de sentimento e a filtragem de SPAM sao exemplos classicos de classificacao de documentos. Na analise de sentimento, o texto pode ser classificado como positivo, negativo ou neutro. Na filtragem de SPAM, a mensagem e separada em spam ou nao spam. Ou seja: em ambas, ha uma decisao de classe, que e exatamente a cara da classificacao. Ja tokenizacao, stopwords, POS-tagging, reconhecimento de entidades, analise sintatica e reconhecimento de linguagem sao tarefas de preprocessamento, etiquetacao ou identificacao linguistica. Elas ajudam a entender o texto, mas nao se limitam a classificar um documento em uma categoria final. Por isso, a banca quer a dupla que tenha apenas tarefas de classificacao, sem misturar outras etapas. Portanto, o gabarito e a alternativa C, porque traz apenas filtragem de SPAM e analise de sentimento, que sao exemplos diretos de classificacao de documentos.

Continue treinando

Questões relacionadas