No contexto de Processamento de Linguagem Natural, a técnica de word embeddings é
- A)uma representação vetorial de palavras em um espaço de baixa dimensão, que preserva relações semânticas entre elas.
Correta: define word embeddings como vetores em baixa dimensao que capturam relacoes semanticas entre palavras.
- B)um método de classificação que utiliza árvores de decisão para analisar o contexto das palavras.
Errada: isso descreve uma tecnica de classificacao, nao uma representacao vetorial de palavras.
- C)um modelo probabilístico que calcula a probabilidade condicional de uma sequência de palavras.
Errada: essa descricao se aproxima de modelos probabilisticos de linguagem, nao de embeddings.
- D)uma técnica de visualização que organiza frases em categorias predefinidas.
Errada: isso fala de visualizacao e categorizacao de frases, o que nao e a funcao de word embeddings.
- E)um tipo de filtragem de dados que remove palavras irrelevantes de um texto.
Errada: remover palavras irrelevantes e tarefa de preprocessing, como stopword removal, nao de embeddings.
Gabarito: A
Word embeddings sao uma forma de representar palavras como vetores em um espaco numerico. A ideia central e simples: palavras que aparecem em contextos parecidos tendem a ficar perto umas das outras nesse espaco, o que ajuda o modelo a captar semelhancas de significado. Em vez de tratar cada palavra como um rótulo isolado, o sistema aprende uma representacao que carrega informacao semantica de verdade. Isso e muito usado em PLN porque o computador nao entende palavras como voce entende; ele precisa transformar texto em numeros. Com embeddings, termos como "rei" e "rainha" podem aparecer em posicoes proximas, assim como "gato" e "felino". E por isso que a tecnica e famosa: ela melhora tarefas como classificacao de textos, busca semantica e analise de sentimentos. O gabarito e a alternativa A porque ela descreve exatamente isso: uma representacao vetorial de palavras em baixa dimensionalidade, preservando relacoes semanticas. A parte de "baixa dimensão" indica que nao se trata de uma codificacao enorme e esparsa, mas de vetores mais compactos e informativos. E o ponto mais importante e a preservacao de contexto e significado. Vale lembrar que word embeddings nao sao, por si so, um classificador, nem um modelo de probabilidade de sequencia, nem uma tecnica de limpeza de texto. Eles sao uma forma de representacao. Em provas, se aparecer a palavra "vetor", "semantica" e "contexto", o radar deve apitar.