Arquiteturas de Big Data são responsáveis por lidar com ingestão, processamento e análise de dados grandes ou complexos demais para sistemas de banco de dados tradicionais. Em relação aos componentes das arquiteturas de Big Data, assinale a afirmativa INCORRETA.
- A)Orquestração: Azure Data Factory não é uma tecnologia de orquestração, não permitindo automatizar fluxos de trabalho.
Errada: o Azure Data Factory e uma ferramenta de orquestracao e integracao de dados, justamente usada para automatizar fluxos de trabalho.
- B)Processamento de fluxo: depois de capturar mensagens em tempo real, a solução precisa processá-las filtrando, agregando e preparando os dados para análise. Os dados de fluxo processados são gravados em um coletor de saída.
Certa: processamento de fluxo trata dados em tempo real, aplicando filtros, agregacoes e outras transformacoes antes de enviar a saida.
- C)Fonte de dados: todas as soluções de Big Data começam com uma ou mais fontes de dados como, por exemplo, armazenamentos de dados de aplicativo, arquivos estáticos produzidos por aplicativos, ou fontes de dados em tempo real.
Certa: toda arquitetura de Big Data parte de uma ou mais fontes de dados, sejam arquivos, aplicativos ou streams.
- D)Processamento em lotes: como os conjuntos de dados são muito grandes, geralmente uma solução de Big Data precisa processar arquivos de dados usando trabalhos em lotes de execução longa para filtrar, agregar e, de outro modo, preparar os dados para análise.
Certa: em Big Data, o processamento em lotes e comum para tratar grandes volumes com trabalhos longos e sequenciais.
- E)Armazenamento de dados: dados de operações de processamento em lotes normalmente são armazenados em um repositório de arquivos distribuído que pode conter amplos volumes de arquivos grandes em vários formatos. Esse tipo de repositório, geralmente é chamado Data Lake.
Certa: dados de lote costumam ser armazenados em Data Lake, que suporta grandes volumes e varios formatos.
Gabarito: A
Em arquiteturas de Big Data, voce costuma ver alguns blocos bem recorrentes: fontes de dados, ingestao, processamento em lotes, processamento de fluxo, armazenamento e orquestracao. A ideia e simples: os dados entram por uma ou mais fontes, passam por etapas de tratamento e depois sao guardados ou enviados para analise, quase sempre em grande volume e com formatos variados. Por isso essas arquiteturas nao dependem de um unico banco tradicional, mas de uma cadeia de servicos que trabalham juntos. A orquestracao serve para coordenar tudo isso: disparar pipelines, agendar tarefas, controlar dependencias e automatizar fluxos de trabalho. O Azure Data Factory, por exemplo, e justamente uma ferramenta de integracao e orquestracao de dados, usada para mover e transformar dados entre diferentes fontes. Entao, quando a alternativa diz que ele nao e tecnologia de orquestracao e nao permite automatizar fluxos, ela troca o conceito pelo avesso. As demais alternativas descrevem componentes classicos de Big Data de forma correta: processamento em fluxo para dados em tempo real, fontes de dados variadas, processamento em lotes para volumes grandes e armazenamento em Data Lake para guardar arquivos em larga escala. Nada de truque escondido aqui, e o desenho geral esta bem alinhado com a pratica de mercado e com a propria documentacao das plataformas de nuvem. Resumo para prova: se a banca falar de orquestracao, pense em automatizacao e coordencao de pipelines. Se afirmar que uma ferramenta consagrada de orquestracao nao faz isso, desconfie na hora.