← Questões de Sistemas Operacionais

Sistemas Operacionais · FGV · 2023

Questão comentada de Sistemas Operacionais

O Apache Spark é um framework para processamento paralelo e oferece suporte ao processamento na memória para aumentar o desempenho de aplicações de big data. Em relação aos RDDs e a suas operações, assinale a afirmativa incorreta.

Gabarito: E

No Apache Spark, os RDDs são a base do processamento distribuído: pense neles como conjuntos de dados resilientes que podem ser divididos entre os nós do cluster. O ponto mais importante aqui é que o Spark tenta não fazer trabalho antes da hora. Ele registra o que voce quer fazer e só executa de fato quando isso se torna necessário. As operações em RDDs se dividem em duas famílias: transformações e ações. Transformações criam novos RDDs, como map, filter e reduceByKey. Já as ações geram um resultado final para o Driver Program ou gravam o resultado externo, como count, collect e reduce. Por isso, a letra E está errada. Ela diz que as transformações só são computadas quando uma ação ou determinadas transformações exigem retorno ao Driver Program. A ideia correta é que as transformações são lazy, ou seja, ficam apenas no plano lógico até que uma ação dispare a execução do grafo de operações. Transformação, por si, não “puxa” execução para o Driver. Esse comportamento de avaliação preguiçosa é um traço clássico do Spark e ajuda a otimizar o processamento, reduzindo etapas desnecessárias e melhorando desempenho. Em prova, desconfie quando a banca misturar transformação com execução imediata: no Spark, quem costuma apertar o botão de começar é a ação.

Continue treinando

Questões relacionadas