← Questões de Banco de Dados

Banco de Dados · FGV · 2022

Questão comentada de Banco de Dados

O analista Pedro definiu no Logstash do TJDFT um novo pipeline de processamento de dados de nome SPipeline. A saída definida em SPipeline exige que os dados sejam estruturados. No entanto, a entrada definida em SPipeline consiste em um arquivo de texto arbitrário e não estruturado. A fim de estruturar a entrada do SPipeline com o uso de expressões regulares, Pedro deve adicionar ao SPipeline o filtro do Logstash:

Gabarito: C

No Logstash, a ideia é montar uma esteira de processamento: entra dado bruto, passa por filtros e sai dado tratado. Quando a entrada é um texto livre, sem estrutura clara, você precisa de um filtro capaz de extrair campos usando padrões, quase como se estivesse “caçando” pedaços do texto com lupa. É exatamente aí que entra o grok. O grok usa expressões regulares e padrões prontos para transformar linhas não estruturadas em campos estruturados. Em provas, isso costuma aparecer com a palavra-chave “texto arbitrário”, “logs”, “arquivo não estruturado” e “expressões regulares”. Se você viu isso, pense em grok na hora. As outras opções confundem porque também são filtros do Logstash, mas com outras funções: mutate altera campos, drop descarta eventos, clone duplica eventos e aggregate junta informações relacionadas. Nenhum deles tem o papel principal de estruturar texto bruto por regex. Então, o gabarito C está correto porque o grok é o filtro do Logstash indicado para extrair e estruturar dados a partir de entradas não estruturadas, justamente o cenário descrito no enunciado.

Continue treinando

Questões relacionadas