No contexto do Hadoop MapReduce Framework, assinale o ciclo típico de tipos de entradas e saídas (input and output) em uma tarefa.
- A)(input) -> filter -> -> sort -> -> mapreduce -> (output)
Errada, porque mistura filter, sort e uma etapa chamada mapreduce como se fossem a sequencia padrao do framework, o que nao corresponde ao fluxo tipico de MapReduce.
- B)(input) -> map -> -> reduce -> (output)
Correta, pois representa a estrutura basica do Hadoop MapReduce com entrada , passagem pelo map e saida do reduce em pares chave-valor.
- C)(input) -> map -> -> combine -> -> reduce -> (output)
Errada, porque inclui combine como se fosse etapa obrigatoria do ciclo, mas o combine eh opcional e nao compoe o fluxo tipico padrao cobrado pela banca.
- D)(input) -> map -> -> filter -> -> reduce -> (output)
Errada, porque insere filter entre map e reduce, e isso nao faz parte da modelagem basica do MapReduce.
- E)(input) -> sort -> -> map -> -> reduce -> (output)
Errada, porque coloca sort antes do map, invertendo a logica real do processamento, em que a organizacao/agrupamento ocorre depois do mapeamento.
Gabarito: B
No Hadoop MapReduce, a ideia central eh simples: voce entra com pares e o processamento acontece em fases bem definidas. Primeiro vem a funcao map, que le a entrada e gera intermediarios em pares . Depois, esses dados passam pelo shuffle/sort, que organiza e agrupa as chaves intermediarias para que valores iguais fiquem juntos. Por fim, a funcao reduce processa esses grupos e produz a saida final . O ponto mais cobrado em prova eh justamente a sequencia padrao de tipos: entrada , saida do map e saida do reduce . O framework pode usar etapas como combine e sort internamente, mas isso nao muda o fluxo basico cobrado em questoes objetivas. Por isso, o gabarito B fica correto no essencial: ele apresenta o encadeamento classico map -> reduce e respeita a logica de transformacao dos pares chave-valor ao longo do processamento. Em concursos, a FGV gosta de ver se voce sabe que MapReduce nao eh um filtro genérico nem um pipeline livre, mas um modelo com entrada, mapeamento e reducao bem caracteristicos. Em resumo: pense em "ler, transformar, agrupar e consolidar". Se voce guardar essa trilha, nao cai na armadilha de trocar a ordem das fases ou inventar operadores que nao fazem parte do modelo basico.