Assinale a opção que melhor descreve a diferença entre os frameworks Apache Spark e Apache Hadoop, no contexto do processamento de Big Data.
- A)O processamento de dados no Spark é mais rápido do que no Hadoop, pois ele é baseado em memória e utiliza RDDs, enquanto o Hadoop é baseado em disco e utiliza MapReduce.
Correta: o Spark tende a ser mais rápido por priorizar processamento em memória com RDDs, enquanto o Hadoop clássico usa MapReduce com escrita em disco.
- B)O processamento de dados no Hadoop é mais rápido do que no Spark, pois o Hadoop é mais escalável e utiliza clusters maiores, enquanto o Spark é limitado pelo tamanho do cluster.
Errada: o Hadoop não é mais rápido que o Spark por ser mais escalável, e o ponto central não é limitação do tamanho do cluster.
- C)O Spark é mais adequado para cargas de trabalho mais pesadas, enquanto o Hadoop é melhor para cargas de trabalho mais leves e interativas.
Errada: a relação está invertida, pois o Spark costuma ser melhor em cargas pesadas e interativas, não o Hadoop.
- D)O Spark e o Hadoop utilizam as mesmas técnicas de processamento de dados, mas o Spark é mais adequado para casos de uso em que a latência é um fator crítico, enquanto o Hadoop é mais adequado para casos de uso em que a capacidade de processamento em lote é mais importante.
Errada: embora ambos sejam usados em Big Data, eles não utilizam as mesmas técnicas de processamento e o Hadoop não é o preferido quando a latência é crítica.
- E)O Hadoop é uma tecnologia mais recente que oferece melhorias, em relação ao Spark, em termos de desempenho e velocidade de processamento.
Errada: o Hadoop não é mais recente que o Spark e não oferece melhor desempenho ou velocidade em relação a ele.
Gabarito: A
Apache Hadoop e Apache Spark aparecem muito em provas quando a banca quer comparar processamento em Big Data. A ideia central é simples: o Hadoop ficou famoso pelo processamento distribuído em lote, com o MapReduce gravando etapas intermediárias em disco, o que aumenta a robustez, mas costuma deixar o processo mais lento. Já o Spark veio para acelerar esse cenário, trabalhando de forma mais intensa em memória e usando RDDs, DataFrames e outros componentes para reduzir o custo de leitura e gravação em disco. Na prática, isso faz o Spark ser geralmente mais rápido, especialmente em tarefas iterativas, consultas interativas e pipelines que reaproveitam dados várias vezes. O Hadoop continua relevante quando a prioridade é processamento massivo com foco em armazenamento distribuído e tolerância a falhas, mas a sua lógica clássica de MapReduce não foi desenhada para latência baixa. Por isso, a alternativa A está correta: ela resume bem a diferença mais cobrada em concurso, isto é, Spark mais veloz por usar memória e RDDs, enquanto Hadoop se apoia no modelo MapReduce com disco. Em termos doutrinários, essa é a distinção padrão entre as arquiteturas, sem necessidade de inventar milagre tecnológico. O truque aqui é perceber que não se trata de "quem faz mais dados", e sim de como cada framework processa esses dados.