← Questões de Engenharia de Software

Engenharia de Software · FGV · 2023

Questão comentada de Engenharia de Software

Ao ser contratado por uma empresa da área de e-commerce, o cientista de dados Pedro foi alocado a um importante projeto: desenvolver um classificador para análise de sentimentos considerando as opiniões emitidas no Twitter pelos clientes dessa empresa. Para o início do trabalho, Pedro recebeu um pequeno conjunto de dados de tweets parcialmente anotados, que foram coletados da rede social por intermédio de uma API, usando como palavras-chave na busca os nomes de diversas empresas de e-commerce. Como parte das escolhas de técnicas a serem utilizadas no projeto, Pedro optou pelo uso de word embeddings, com o objetivo de resolver o problema muito comum em processamento de linguagem natural de:

Gabarito: C

Em problemas de processamento de linguagem natural, um desafio clássico é transformar palavras em números sem fazer o modelo sofrer com uma quantidade enorme de atributos. É aí que entram os word embeddings: em vez de representar cada palavra por um vetor esparso gigantesco, eles aprendem representações densas e menores, capturando semelhança semântica entre termos. Isso ajuda o classificador a enxergar padrões com muito mais eficiência. A ideia principal dos embeddings não é criar rótulos automaticamente, nem aumentar a base de dados, nem remover outliers. O papel deles é representar palavras em um espaço vetorial compacto, o que reduz o problema da alta dimensionalidade. Em termos práticos, palavras com sentidos parecidos tendem a ficar próximas nesse espaço, o que costuma melhorar o desempenho de tarefas como análise de sentimentos. Por isso, a alternativa correta é a C. A técnica é usada justamente para combater a maldição da dimensionalidade, um problema típico quando se trabalha com texto bruto, que costuma gerar vetores muito grandes e pouco práticos. Em vez de uma multidão de zeros, você passa a ter representações enxutas e informativas. Se a questão lembrasse outras técnicas de PLN, aí sim apareceria lematização, stemming, oversampling ou rotulagem automática. Mas word embeddings não fazem esse papel. Eles são, por assim dizer, a versão compacta e inteligente das palavras no computador.

Continue treinando

Questões relacionadas