O analista Pedro definiu no Logstash do TJDFT um novo pipeline de processamento de dados de nome SPipeline. A saída definida em SPipeline exige que os dados sejam estruturados. No entanto, a entrada definida em SPipeline consiste em um arquivo de texto arbitrário e não estruturado. A fim de estruturar a entrada do SPipeline com o uso de expressões regulares, Pedro deve adicionar ao SPipeline o filtro do Logstash:
- A)drop;
Errada, porque drop serve para eliminar eventos do fluxo, e não para extrair campos de texto não estruturado.
- B)mutate;
Errada, porque mutate altera ou transforma campos já existentes, mas não faz a extração por padrões regex típica da estruturação de logs brutos.
- C)grok;
Certa, porque grok é o filtro do Logstash usado para extrair campos de textos não estruturados com apoio de expressões regulares.
- D)clone;
Errada, porque clone apenas cria cópias de eventos para processamento paralelo ou separado, sem estruturar a entrada.
- E)aggregate.
Errada, porque aggregate é usado para combinar eventos correlacionados, não para interpretar e estruturar texto arbitrário.
Gabarito: C
No Logstash, a ideia é montar uma esteira de processamento: entra dado bruto, passa por filtros e sai dado tratado. Quando a entrada é um texto livre, sem estrutura clara, você precisa de um filtro capaz de extrair campos usando padrões, quase como se estivesse “caçando” pedaços do texto com lupa. É exatamente aí que entra o grok. O grok usa expressões regulares e padrões prontos para transformar linhas não estruturadas em campos estruturados. Em provas, isso costuma aparecer com a palavra-chave “texto arbitrário”, “logs”, “arquivo não estruturado” e “expressões regulares”. Se você viu isso, pense em grok na hora. As outras opções confundem porque também são filtros do Logstash, mas com outras funções: mutate altera campos, drop descarta eventos, clone duplica eventos e aggregate junta informações relacionadas. Nenhum deles tem o papel principal de estruturar texto bruto por regex. Então, o gabarito C está correto porque o grok é o filtro do Logstash indicado para extrair e estruturar dados a partir de entradas não estruturadas, justamente o cenário descrito no enunciado.