Necessidade de uma fonte única para a consulta de dados,sejam esses granulares ou agregados.
Inclusão das fontes públicas dentro do contexto de Data Lake;
Automação do processamento de dados;
Necessidade de um layout para controle dos processos;
Disponibilização dos dados de forma democrática aos cientistas e analistas.
Soluções_
Criação do Data Lake com segmentações lógicas - Landing (bronze / raw), silver e gold;
Desenvolvimento de scripts no Azure Databricks para a captura dos dados. Automação (respeitando o período de atualização de cada fonte) utilizando o Azure DataFactory;
Utilização do Azure DataFactory e criação de rotinas globais de data cleasing (stage to silver); aplicação de regras de curadoria dinamicas;
Deploy de tabelas no Azure Data Tables; comunicação com o serviço através de SDKs - criação de funções globais;
Disponibilização da camada silver (fato/dimensão) em um SQLServer, com rotinas de atualização vinculadas ao Data Lake.
Benefícios_
Dinamicidade de consultas; maior velocidade no movimento de exploração dos dados, o que resulta em entregas mais ágeis e precisas;
Visibilidade no processo de ingestão das cargas; maior controle sobre as etapas do processo de desenvolvimento; facilitação no processo de captura de logs utilizando ferramentas nativas (logs Analytics ADF);
Maior controle sobre o processamento dos dados; facilidade no movimento de data cleasing, que agora utiliza-se apenas de parâmetros enviados à rotina para a manutenção dos datasets;
Velocidade no processo de passagem de parâmetros, que não serão incluídos diretamente nos scripts, mas sim nas tabelas de referência, seguindo o padrão estipulado;
Maiores possibilidades de integração com ferramentas de visualização e ERPs; escalabilidade dinâmica de acordo com a necessidade dos processos.