Um cientista de dados está ponderando sobre a aplicação de um modelo Paragraph Vector (PV-DM) sobre uma coleção de documentos, no lugar de usar a média de vetores de palavras em cada documento. Uma razão pela qual ele deveria aplicar PV-DM, e uma contrapartida à sua aplicação, são, respectivamente:
- A)considera a ordem das palavras; maior custo computacional;
Correta, porque o PV-DM leva em conta o contexto e a ordem das palavras, mas exige maior custo computacional para treinamento.
- B)menor custo computacional; menor precisão;
Errada, porque PV-DM não reduz o custo computacional nem necessariamente reduz a precisão em comparação com a média de vetores.
- C)vetores mais compactos; menor expressividade dos vetores;
Errada, porque vetores mais compactos não é a principal vantagem do PV-DM, e a afirmação sobre menor expressividade não corresponde ao modelo.
- D)maior expressividade dos vetores; não considera a ordem das palavras;
Errada, porque a primeira parte troca a vantagem real por uma generalização, e o modelo sim considera a ordem das palavras no contexto.
- E)vetores mais densos, não considera a ordem das sentenças.
Errada, porque a formulação mistura conceitos e afirma que não considera a ordem das sentenças, o que não é a comparação pedida nem caracteriza bem o PV-DM.
Gabarito: A
O Paragraph Vector, especialmente na versão PV-DM, é uma técnica de representação de documentos que tenta capturar o sentido do texto como um todo, e não só somar palavras como se estivesse fazendo uma conta de padaria. Em vez de usar apenas a média dos vetores das palavras, ele aprende um vetor para o documento e o combina com palavras do contexto para prever o próximo termo, o que ajuda a incorporar informação de ordem e contexto local. Por isso, uma vantagem do PV-DM é justamente considerar a ordem das palavras no contexto, ainda que de forma limitada, o que costuma melhorar a qualidade da representação em comparação com a simples média de vetores. Em contrapartida, esse ganho vem com custo: o treinamento é mais pesado e mais lento, porque o modelo precisa aprender vetores de documentos além dos vetores das palavras. É essa combinação que torna o gabarito A correto: ele aponta uma característica favorável do PV-DM, que é considerar a ordem das palavras, e uma desvantagem real, que é o maior custo computacional. Em questões de NLP, a FGV costuma cobrar essa comparação direta entre modelos mais simples de bag-of-words ou média de embeddings e modelos que aprendem representação distribuída do documento. Em resumo: se você quer uma representação mais inteligente do texto, o PV-DM costuma ser melhor; se quer simplicidade e rapidez, a média de vetores pode ser suficiente. O preço da sofisticação, aqui, é processamento extra. A máquina pensa um pouco mais, e o bolso computacional sente.