Lino precisa preparar um grande volume de dados para minerar realizando operações de limpeza, adequação de formato, exclusão de brancos e inclusão de novos atributos derivados. Para realizar o pré-processamento dos dados, Lino deve usar uma ferramenta do tipo:
- A)ETL;
Certa, porque ETL é o processo usado para extrair, transformar e carregar dados, incluindo limpeza e padronização antes da análise.
- B)OLAP;
Errada, porque OLAP serve para análise multidimensional de dados já preparados, não para pré-processamento.
- C)Apriori;
Errada, porque Apriori é um algoritmo de mineração de dados para regras de associação, não uma ferramenta de ETL.
- D)Data Mart;
Errada, porque Data Mart é uma base temática derivada para consulta e análise, não um mecanismo de limpeza e transformação.
- E)Data Lake
Errada, porque Data Lake é um repositório de armazenamento de dados em grande volume, frequentemente brutos, e não uma ferramenta de pré-processamento.
Gabarito: A
Quando a questão fala em preparar dados para mineração, com limpeza, padronização de formato, remoção de espaços em branco e criação de atributos derivados, ela está descrevendo a etapa de pré-processamento. Nesse contexto, a ferramenta adequada é de ETL, sigla para Extract, Transform, Load, porque ela existe justamente para extrair dados de várias fontes, transformá-los e deixá-los prontos para uso analítico. O ponto central é a palavra "Transform". É nessa fase que entram tarefas como tratamento de nulos, ajuste de formatos, normalização, exclusão de brancos extras e criação de campos calculados. Em projetos de BI e mineração de dados, isso evita que lixo entre no sistema e atrapalhe a análise - afinal, dado ruim produz resultado ruim. OLAP não é ferramenta de preparação, e sim de análise multidimensional, com consultas e agregações sobre dados já tratados. Apriori é um algoritmo de mineração de regras de associação, não um processo de limpeza. Data Mart é um subconjunto temático de dados para apoio à decisão, e Data Lake é um repositório amplo de dados, geralmente brutos, não a etapa de tratamento em si. Portanto, o gabarito A está correto porque ETL é exatamente o mecanismo usado para extrair, transformar e carregar os dados antes da mineração. Em termos doutrinários de engenharia e arquitetura de dados, essa é a fase clássica de integração e preparação da informação.