Imagine que voce tem uma montanha de dados brutos — registros de vendas, cliques de usuarios, leituras de sensores — e precisa transformar tudo isso em informacoes uteis. Como fazer isso em larga escala? Este post explica as ferramentas do Azure para esse trabalho.
ETL vs ELT — em que ordem ocorre a transformacao?
Antes de falar sobre servicos, e preciso entender dois conceitos fundamentais: ETL e ELT.
Pense em cozinhar como analogia.
Com ETL (Extrair, Transformar, Carregar), voce lava, corta e tempera os ingredientes antes de colocar na panela. A transformacao acontece antes de o dado chegar ao destino.
Com ELT (Extrair, Carregar, Transformar), voce coloca tudo na panela primeiro e so depois ajusta. A transformacao acontece dentro do sistema de destino.
| Aspecto | ETL | ELT | |---------|-----|-----| | Ordem | Extrair, Transformar, Carregar | Extrair, Carregar, Transformar | | Onde transforma | Servidor intermediario | Sistema de destino | | Melhor para | Pequena escala, transformacoes complexas | Grande escala, destino poderoso |
No Azure, o ELT e mais comum porque o sistema de destino (como o Synapse) e muito poderoso.
!ETL vs ELT
Azure Synapse Analytics — a plataforma tudo-em-um
Pense no Synapse como uma cozinha industrial com todos os equipamentos em um so lugar. Antes do Synapse, as empresas precisavam de servicos separados para ingerir, transformar e analisar dados. O Synapse unifica tudo.
SQL Pool dedicado
Como reservar uma mesa em um restaurante — voce paga para ter aquela mesa disponivel o tempo todo. E um data warehouse provisionado com recursos fixos e desempenho estavel.
SQL Pool sem servidor
Como um taxi — voce paga apenas quando usa. Cobra por consulta, aponta para dados no Azure Data Lake e executa SQL sem provisionar nada.
Pool Apache Spark
Como ter uma equipe inteira de analistas trabalhando em paralelo. Ideal para grandes volumes de dados, machine learning e analise exploratoria.
Pipelines integrados
O Synapse inclui pipelines integrados com a mesma tecnologia do Azure Data Factory.
Azure Databricks — o notebook colaborativo para ciencia de dados
Enquanto o Synapse e uma cozinha industrial completa, o Databricks e mais como um laboratorio de pesquisa colaborativo — onde cientistas de dados escrevem codigo e experimentam em tempo real.
O Delta Lake adiciona confiabilidade ao data lake: transacoes ACID, time travel (visualizar dados do passado) e controle de qualidade de schema. Data lake + confiabilidade de banco de dados = Delta Lake.
Azure Data Factory — o encanador de dados sem codigo
Pense no Data Factory como um sistema de encanamento de dados. Ele conecta mais de 90 fontes de dados diferentes e move dados entre elas — sem escrever codigo. A interface e visual, com arrastar e soltar.
Usos tipicos: copiar dados de um SQL local para o Azure, mover arquivos do Amazon S3, agendar pipelines automaticos noturnos.
Microsoft Fabric — a plataforma unificada de proxima geracao
O Microsoft Fabric e a visao mais recente da Microsoft: uma plataforma SaaS que unifica ingestao, transformacao, analytics, ciencia de dados e visualizacao em um so lugar.
O OneLake e seu conceito central: um unico repositorio centralizado para todos os dados da organizacao. Em vez de dados espalhados em multiplas contas de armazenamento, tudo fica em um unico lago.
Lakehouse — o melhor dos dois mundos
Um data lake e flexivel e barato, mas dificil de consultar com SQL. Um data warehouse e rapido para SQL, mas caro e aceita apenas dados estruturados.
O lakehouse combina os dois: flexibilidade do data lake + capacidade de consulta do warehouse.
| Caracteristica | Data Lake | Data Warehouse | Lakehouse | |---------------|-----------|----------------|-----------| | Tipos de dados | Qualquer | Apenas estruturado | Qualquer | | Custo | Baixo | Alto | Baixo | | Consultas SQL | Limitado | Excelente | Bom | | Machine Learning | Excelente | Limitado | Excelente |
Pontos-chave para o exame
"Plataforma analitica unificada (SQL + Spark + pipelines)" -- Azure Synapse Analytics "Data warehouse provisionado com recursos fixos" -- Synapse Dedicated SQL Pool "Pago por consulta, sem provisionamento" -- Synapse Serverless SQL Pool "Big data e machine learning com Spark" -- Synapse Apache Spark Pool "Notebook colaborativo baseado em Spark" -- Azure Databricks "ACID + time travel no data lake" -- Delta Lake "Pipelines sem codigo, mais de 90 conectores" -- Azure Data Factory "Plataforma SaaS unificada com OneLake" -- Microsoft Fabric "Flexibilidade do lake + estrutura do warehouse" -- Lakehouse "Transformar no destino, grande escala" -- ELT