← Questões de Tecnologia da Informação

Tecnologia da Informação · FGV · 2022

Questão comentada de Tecnologia da Informação

Um cientista de dados está ponderando sobre a aplicação de um modelo Paragraph Vector (PV-DM) sobre uma coleção de documentos, no lugar de usar a média de vetores de palavras em cada documento. Uma razão pela qual ele deveria aplicar PV-DM, e uma contrapartida à sua aplicação, são, respectivamente:

Gabarito: A

O Paragraph Vector, especialmente na versão PV-DM, é uma técnica de representação de documentos que tenta capturar o sentido do texto como um todo, e não só somar palavras como se estivesse fazendo uma conta de padaria. Em vez de usar apenas a média dos vetores das palavras, ele aprende um vetor para o documento e o combina com palavras do contexto para prever o próximo termo, o que ajuda a incorporar informação de ordem e contexto local. Por isso, uma vantagem do PV-DM é justamente considerar a ordem das palavras no contexto, ainda que de forma limitada, o que costuma melhorar a qualidade da representação em comparação com a simples média de vetores. Em contrapartida, esse ganho vem com custo: o treinamento é mais pesado e mais lento, porque o modelo precisa aprender vetores de documentos além dos vetores das palavras. É essa combinação que torna o gabarito A correto: ele aponta uma característica favorável do PV-DM, que é considerar a ordem das palavras, e uma desvantagem real, que é o maior custo computacional. Em questões de NLP, a FGV costuma cobrar essa comparação direta entre modelos mais simples de bag-of-words ou média de embeddings e modelos que aprendem representação distribuída do documento. Em resumo: se você quer uma representação mais inteligente do texto, o PV-DM costuma ser melhor; se quer simplicidade e rapidez, a média de vetores pode ser suficiente. O preço da sofisticação, aqui, é processamento extra. A máquina pensa um pouco mais, e o bolso computacional sente.

Continue treinando

Questões relacionadas