O ElasticSearch é o motor de buscas e análises por trás da Elastic Stack. Ele é capaz de proceder a análises de textos em dois momentos distintos (tempo de indexação e tempo de busca). Os componentes analisadores de texto são denominados
- A)Filtros Padrão, Filtros de Características e Filtros Personalizados.
Errada, porque “filtros padrão” e “filtros de características” não são a nomenclatura correta dos componentes analisadores do ElasticSearch.
- B)Tokenizadores, Filtros de Log e Filtros Personalizados.
Errada, porque tokenizadores existem, mas “filtros de log” não fazem parte da análise de texto do ElasticSearch.
- C)Filtros de Caracteres, Tokenizadores e Filtros de Tokens.
Certa, porque o ElasticSearch usa filtros de caracteres, tokenizadores e filtros de tokens como componentes do analisador de texto.
- D)Filtros de Log, Filtros de Caracteres e Filtros de Tokens.
Errada, porque “filtros de log” não compõem o pipeline de análise textual do ElasticSearch.
- E)Filtros Personalizados, Filtros de Características e Filtros de Log.
Errada, porque mistura nomes inexistentes ou inadequados no contexto do analisador de texto do ElasticSearch.
Gabarito: C
No ElasticSearch, a análise de texto é o processo de preparar um conteúdo para busca, tanto na hora de indexar quanto na hora de pesquisar. Pense assim: o texto entra cru e passa por uma pequena linha de montagem para ficar mais “amigável” ao mecanismo de busca. Essa linha de montagem tem etapas bem definidas, e a banca costuma cobrar exatamente os nomes dessas etapas. Os componentes analisadores de texto do ElasticSearch são três: filtros de caracteres, tokenizadores e filtros de tokens. Primeiro, os filtros de caracteres fazem ajustes ainda no texto bruto, como remover ou trocar símbolos. Depois, o tokenizador quebra o texto em unidades menores, normalmente palavras. Por fim, os filtros de tokens refinam esses termos, por exemplo reduzindo para minúsculas, removendo palavras irrelevantes ou aplicando stemming. É por isso que o gabarito é a letra C. Ela traz exatamente a sequência correta dos componentes do analisador de texto no ElasticSearch. As demais alternativas misturam termos que não correspondem à arquitetura oficial da análise de texto da ferramenta, tentando confundir com nomes parecidos ou inventados. Na prática, isso cai bastante em provas de banco de dados e ferramentas de busca: a banca quer saber se você reconhece que o analisador trabalha com etapas de pré-processamento e normalização do texto. Se você lembrar da ordem “caracteres -> tokens -> filtros de tokens”, já está muito bem servido.