Dados massivos são grandes grupos de dados que podem ser capturados, comunicados, agregados, armazenados e analisados. Uma das plataformas de processamento de dados massivos mais conhecidas é o Apache Hadoop. Sobre tal plataforma, assinale a afirmativa correta.
- A)Trata-se da implementação mais popular, de código aberto, do MapReduce.
Correta: o Apache Hadoop é a implementação open source mais conhecida do modelo MapReduce para processamento distribuído de grandes volumes de dados.
- B)É a solução mais adequada para o processamento de arquivos pequenos.
Errada: Hadoop não é voltado para arquivos pequenos, pois seu desenho faz mais sentido quando há grande volume e processamento distribuído.
- C)Refere-se uma plataforma verticalmente escalável e não tolerante a falhas, mas muito utilizada para processamento massivo de dados.
Errada: Hadoop é horizontalmente escalável e tolerante a falhas, não verticalmente escalável nem frágil em caso de pane.
- D)Sua maior desvantagem é o fato de não possibilitar a utilização de máquinas e rede convencionais para realizar o processamento da sua massa de dados.
Errada: uma vantagem do Hadoop é justamente poder usar máquinas e rede convencionais para compor o cluster.
- E)Somente permite a execução de aplicações desde que seja implantado seu próprio aglomerado de máquinas, ou seja, não permite a utilização de serviços em nuvem.
Errada: Hadoop pode ser usado em ambientes próprios e também em nuvem, não ficando restrito a um aglomerado exclusivo.
Gabarito: A
Apache Hadoop é uma plataforma de software de código aberto criada para lidar com grandes volumes de dados em ambiente distribuído. A ideia central é simples: dividir o trabalho entre várias máquinas, em vez de tentar resolver tudo em um único computador gigante. Isso traz escalabilidade horizontal, tolerância a falhas e uso de hardware comum, o que derruba o custo da operação. O Hadoop ficou famoso por seu ecossistema, especialmente pelo HDFS para armazenamento distribuído e pelo MapReduce para processamento paralelo. Na prática, ele foi pensado para dados massivos, não para arquivos pequenos e triviais, porque o ganho aparece quando o volume é realmente grande. Então, quando a questão fala em grandes grupos de dados e plataforma conhecida de processamento, ela está apontando exatamente para esse modelo. O gabarito é a letra A porque o Apache Hadoop é a implementação mais popular, de código aberto, do paradigma MapReduce. Em outras palavras, ele se tornou a referência clássica para processamento distribuído de grandes massas de dados, com execução paralela em cluster e tolerância a falhas. As demais alternativas tentam inverter características essenciais: Hadoop não é verticalmente escalável, pelo contrário, ele se destaca pela escalabilidade horizontal; também não depende de máquinas especiais, nem impede uso em nuvem. É aquele tipo de questão que testa se você conhece o “DNA” do Hadoop, e não só o nome bonito.