No projeto de arquitetura de um data lake, a primeira etapa que deve estar prevista é a
- A)criação de um ambiente virtual de captura de dados.
Certa, porque a arquitetura de um data lake começa pela ingestão/captura dos dados em um ambiente preparado para recebê-los.
- B)concessão de acesso ao banco de dados (somente leitura) aos cientistas de dados, para estes realizarem experimentos e testes.
Errada, porque acesso de leitura a cientistas de dados é etapa de uso, não a primeira etapa de arquitetura do data lake.
- C)integração dos dados do data lake aos data warehouses da empresa.
Errada, porque integração com data warehouses é uma ação posterior e até opcional, não o ponto de partida.
- D)atualização dos dados dos repositórios de dados da empresa a partir dos dados já consolidados disponíveis no data lake.
Errada, porque atualizar outros repositórios a partir do lake inverte a lógica do fluxo e não representa a etapa inicial.
- E)visualização de dados e otimização das principais consultas.
Errada, porque visualização e otimização de consultas são fases de consumo e performance, bem depois da captura e do armazenamento.
Gabarito: A
Em arquitetura de data lake, a ideia central é guardar dados em seu formato bruto, com pouca ou nenhuma estrutura prévia, para depois tratar, integrar e explorar conforme a necessidade. Antes de pensar em dashboard bonito, consulta otimizada ou integração com outros repositórios, você precisa de uma base capaz de receber dados de várias fontes. É por isso que a etapa inicial costuma ser a criação de um ambiente de captura e ingestão de dados, isto é, o mecanismo que coleta, recebe e armazena os dados no lake. Pense no data lake como um grande reservatório: primeiro você precisa trazer a água para dentro, depois filtrar, separar e usar. Se você tentar começar pela visualização ou pela otimização de consultas, está pulando etapas essenciais da arquitetura. Em prova, a banca costuma explorar essa ordem lógica do fluxo: ingestão, armazenamento, processamento e, só depois, consumo analítico. O gabarito é a letra A porque a primeira etapa prevista na arquitetura do data lake é justamente montar o ambiente de captura de dados, que faz a entrada dos dados no sistema. Isso é coerente com a própria definição de data lake, muito associada a ingestão ampla de dados estruturados, semiestruturados e não estruturados, para tratamento posterior. Não há um fundamento legal específico para isso, porque se trata de conceito técnico de arquitetura de dados, tratado principalmente pela doutrina de tecnologia e engenharia de dados.