← Questões de Banco de Dados

Banco de Dados · FGV · 2023

Questão comentada de Banco de Dados

Assinale a opção que melhor descreve a diferença entre os frameworks Apache Spark e Apache Hadoop, no contexto do processamento de Big Data.

Gabarito: A

Apache Hadoop e Apache Spark aparecem muito em provas quando a banca quer comparar processamento em Big Data. A ideia central é simples: o Hadoop ficou famoso pelo processamento distribuído em lote, com o MapReduce gravando etapas intermediárias em disco, o que aumenta a robustez, mas costuma deixar o processo mais lento. Já o Spark veio para acelerar esse cenário, trabalhando de forma mais intensa em memória e usando RDDs, DataFrames e outros componentes para reduzir o custo de leitura e gravação em disco. Na prática, isso faz o Spark ser geralmente mais rápido, especialmente em tarefas iterativas, consultas interativas e pipelines que reaproveitam dados várias vezes. O Hadoop continua relevante quando a prioridade é processamento massivo com foco em armazenamento distribuído e tolerância a falhas, mas a sua lógica clássica de MapReduce não foi desenhada para latência baixa. Por isso, a alternativa A está correta: ela resume bem a diferença mais cobrada em concurso, isto é, Spark mais veloz por usar memória e RDDs, enquanto Hadoop se apoia no modelo MapReduce com disco. Em termos doutrinários, essa é a distinção padrão entre as arquiteturas, sem necessidade de inventar milagre tecnológico. O truque aqui é perceber que não se trata de "quem faz mais dados", e sim de como cada framework processa esses dados.

Continue treinando

Questões relacionadas