No contexto de ferramentas de integração de ambientes de Big Data e Banco de Dados relacionais, associe cada descrição a seguir à respectiva ferramenta. 1. Apache Kafka. 2. Apache Sqoop. ( ) Muito usado para transferência de dados entre bancos relacionais para o ecossistema Hadoop. ( ) Suas transferências de dados são baseadas em lotes, focando em transferências programadas ou sob demanda. ( ) Muito usado para streaming de dados em tempo real. ( ) Trabalha com mensageria distribuída, baseada no conceito de tópicos, permite que produtores enviem mensagens e consumidores as processem de forma assíncrona. A associação correta, na ordem apresentada, é
- A)1 – 1 – 2 – 2.
Errada, porque troca as funcoes das ferramentas nas duas primeiras afirmacoes e tambem inverte as caracteristicas de streaming e mensageria.
- B)2 – 1 – 1 – 2.
Errada, porque atribui Kafka a transferencia em lote e Sqoop ao streaming, o que contraria o uso tipico de cada ferramenta.
- C)1 – 1 – 2 – 1.
Errada, porque acerta duas associacoes, mas erra a mensageria distribuida com topicos, que nao e Sqoop.
- D)2 – 1 – 2 – 1.
Errada, porque mistura uma caracteristica de lote com Kafka e uma de streaming com Sqoop, invertendo o papel central das ferramentas.
- E)2 – 2 – 1 – 1.
Certa, porque Sqoop corresponde as transferencias em lote entre bancos relacionais e Hadoop, e Kafka corresponde ao streaming em tempo real e a mensageria baseada em topicos.
Gabarito: E
Aqui a banca quer que voce diferencie duas ferramentas que costumam aparecer juntas no mundo Big Data, mas fazem trabalhos bem diferentes. O Apache Sqoop é voltado para movimentar dados entre bancos relacionais e o ecossistema Hadoop, normalmente em cargas em lote, isto é, transferencias programadas ou sob demanda. Ele nao foi pensado para fluxo continuo em tempo real, e sim para importar e exportar grandes volumes de dados de forma mais tradicional. Ja o Apache Kafka entra na area de mensageria e streaming. Ele trabalha com topicos, produtores enviando mensagens e consumidores lendo de forma assincrona, o que o torna muito forte para processamento em tempo real. Se a frase falar em mensageria distribuida, topicos, produtores e consumidores, pense em Kafka sem hesitar. Aplicando isso as descricoes: a transferencia entre bancos relacionais e Hadoop aponta para Sqoop; a transferencia em lotes tambem aponta para Sqoop; streaming em tempo real aponta para Kafka; e a mensageria distribuida baseada em topicos tambem aponta para Kafka. Por isso, a sequencia correta e 2 - 2 - 1 - 1, que corresponde a alternativa E. Em termos doutrinarios, essa divisao e a mais classica: Sqoop faz integração batch entre RDBMS e Hadoop, enquanto Kafka faz ingestao e distribuicao de eventos em tempo real. A banca costuma cobrar exatamente essa separacao de finalidade, sem misturar as funcoes.