Ao ser contratado por uma empresa da área de e-commerce, o cientista de dados Pedro foi alocado a um importante projeto: desenvolver um classificador para análise de sentimentos considerando as opiniões emitidas no Twitter pelos clientes dessa empresa. Para o início do trabalho, Pedro recebeu um pequeno conjunto de dados de tweets parcialmente anotados, que foram coletados da rede social por intermédio de uma API, usando como palavras-chave na busca os nomes de diversas empresas de e-commerce. Como parte das escolhas de técnicas a serem utilizadas no projeto, Pedro optou pelo uso de word embeddings, com o objetivo de resolver o problema muito comum em processamento de linguagem natural de:
- A)falta de anotação nos tweets, pois essa técnica gera automaticamente a anotação a partir das palavras que compõem o texto;
Errada, porque word embeddings não fazem anotação automática dos tweets, apenas transformam palavras em representações vetoriais.
- B)baixa quantidade de instâncias no conjunto de dados, pois essa técnica produz sobreamostragem da classe minoritária do conjunto de dados, incrementando-o;
Errada, porque embeddings não realizam sobreamostragem nem aumentam o número de instâncias do conjunto de dados.
- C)maldição da dimensionalidade, pois essa técnica permite a representação das palavras como vetores de baixa dimensionalidade;
Certa, porque word embeddings reduzem a dimensionalidade da representação das palavras, ajudando a enfrentar a maldição da dimensionalidade.
- D)presença de outliers, pois essa técnica elimina as instâncias que não apresentam similaridade ao conjunto de dados como um todo;
Errada, porque embeddings não eliminam outliers; eles apenas aprendem representações numéricas para palavras.
- E)flexão de palavras, pois essa técnica reduz substantivos flexionados em gênero ou número e verbos conjugados às suas formas mais básicas.
Errada, porque isso descreve stemming ou lematização, e não word embeddings.
Gabarito: C
Em problemas de processamento de linguagem natural, um desafio clássico é transformar palavras em números sem fazer o modelo sofrer com uma quantidade enorme de atributos. É aí que entram os word embeddings: em vez de representar cada palavra por um vetor esparso gigantesco, eles aprendem representações densas e menores, capturando semelhança semântica entre termos. Isso ajuda o classificador a enxergar padrões com muito mais eficiência. A ideia principal dos embeddings não é criar rótulos automaticamente, nem aumentar a base de dados, nem remover outliers. O papel deles é representar palavras em um espaço vetorial compacto, o que reduz o problema da alta dimensionalidade. Em termos práticos, palavras com sentidos parecidos tendem a ficar próximas nesse espaço, o que costuma melhorar o desempenho de tarefas como análise de sentimentos. Por isso, a alternativa correta é a C. A técnica é usada justamente para combater a maldição da dimensionalidade, um problema típico quando se trabalha com texto bruto, que costuma gerar vetores muito grandes e pouco práticos. Em vez de uma multidão de zeros, você passa a ter representações enxutas e informativas. Se a questão lembrasse outras técnicas de PLN, aí sim apareceria lematização, stemming, oversampling ou rotulagem automática. Mas word embeddings não fazem esse papel. Eles são, por assim dizer, a versão compacta e inteligente das palavras no computador.