← Questões de Banco de Dados

Banco de Dados · FGV · 2022

Questão comentada de Banco de Dados

O ElasticSearch é o motor de buscas e análises por trás da Elastic Stack. Ele é capaz de proceder a análises de textos em dois momentos distintos (tempo de indexação e tempo de busca). Os componentes analisadores de texto são denominados

Gabarito: C

No ElasticSearch, a análise de texto é o processo de preparar um conteúdo para busca, tanto na hora de indexar quanto na hora de pesquisar. Pense assim: o texto entra cru e passa por uma pequena linha de montagem para ficar mais “amigável” ao mecanismo de busca. Essa linha de montagem tem etapas bem definidas, e a banca costuma cobrar exatamente os nomes dessas etapas. Os componentes analisadores de texto do ElasticSearch são três: filtros de caracteres, tokenizadores e filtros de tokens. Primeiro, os filtros de caracteres fazem ajustes ainda no texto bruto, como remover ou trocar símbolos. Depois, o tokenizador quebra o texto em unidades menores, normalmente palavras. Por fim, os filtros de tokens refinam esses termos, por exemplo reduzindo para minúsculas, removendo palavras irrelevantes ou aplicando stemming. É por isso que o gabarito é a letra C. Ela traz exatamente a sequência correta dos componentes do analisador de texto no ElasticSearch. As demais alternativas misturam termos que não correspondem à arquitetura oficial da análise de texto da ferramenta, tentando confundir com nomes parecidos ou inventados. Na prática, isso cai bastante em provas de banco de dados e ferramentas de busca: a banca quer saber se você reconhece que o analisador trabalha com etapas de pré-processamento e normalização do texto. Se você lembrar da ordem “caracteres -> tokens -> filtros de tokens”, já está muito bem servido.

Continue treinando

Questões relacionadas