← Questões de Banco de Dados

Banco de Dados · FGV · 2025

Questão comentada de Banco de Dados

O Apache Spark é um mecanismo de análise unificado para processamento de dados em grande escala com diversas aplicações em ciência de dados, machine learning e processamento de gráficos. Considerando essa ferramenta, julgue as afirmativas a seguir. I. O Spark pode ser executado no Apache Hadoop, Kubernetes, por conta própria, na nuvem, em máquinas isoladas ou em clusters. II. DataFrames, SQL e Structured Streaming são exemplos de APIs do Spark. III. Uma diferença entre o Spark e o MapReduce é que o Spark processa e mantém os dados na memória para as etapas subsequentes, sem gravar ou ler do disco, gerando maior velocidade de processamento. Está correto o que se afirma em

Gabarito: E

O Spark é uma plataforma bem versátil para processamento distribuído, e a ideia central da questão é essa: ele não fica preso a um único ambiente de execução. Você pode rodá-lo sobre Hadoop, em Kubernetes, em máquinas isoladas, em cluster próprio ou até em nuvem, o que torna a afirmativa I verdadeira. Em concurso, isso costuma aparecer como uma característica de “portabilidade” e facilidade de integração do Spark com diferentes infraestruturas. A afirmativa II também está correta. DataFrames, SQL e Structured Streaming são, de fato, interfaces/APIs muito conhecidas do Spark para trabalhar com dados estruturados, fazer consultas e lidar com fluxos de dados em tempo real. Na prática, é como se o Spark oferecesse várias portas de entrada para o mesmo motor: você escolhe a que faz mais sentido para o problema. A afirmativa III também é verdadeira e é um ponto clássico de comparação com o MapReduce. O Spark foi projetado para usar memória de forma intensiva, reduzindo leituras e gravações em disco entre etapas do processamento, o que acelera bastante as operações, especialmente quando há reutilização dos dados. Isso é uma das grandes razões de o Spark ser tão usado em analytics e machine learning. Por isso, o gabarito é a letra E: as três afirmativas estão corretas. Se você lembrar que o Spark é multiambiente, tem APIs variadas e ganha velocidade ao trabalhar muito em memória, já resolve boa parte das questões sobre o tema.

Continue treinando

Questões relacionadas