Imagina que tienes una montana de datos sin procesar — registros de ventas, clics de usuarios, lecturas de sensores — y necesitas convertir todo eso en informacion util. Como hacerlo a gran escala? Este post explica las herramientas de Azure creadas exactamente para eso.
ETL vs ELT — en que orden ocurre la transformacion?
Antes de hablar de servicios, necesitas entender dos conceptos fundamentales: ETL y ELT.
Piensa en cocinar como analogia.
Con ETL (Extraer, Transformar, Cargar), lavas, cortas y condimentas los ingredientes antes de ponerlos en la olla. La transformacion ocurre antes de que el dato llegue a su destino final.
Con ELT (Extraer, Cargar, Transformar), metes todo en la olla primero y luego ajustas. La transformacion ocurre dentro del sistema de destino.
| Aspecto | ETL | ELT | |---------|-----|-----| | Orden | Extraer, Transformar, Cargar | Extraer, Cargar, Transformar | | Donde transforma | Servidor intermedio | Sistema de destino | | Mejor para | Pequena escala, transformaciones complejas | Gran escala, destino poderoso |
En Azure, ELT es mas comun porque el sistema de destino (como Synapse) es muy potente.
!ETL vs ELT
Azure Synapse Analytics — el espacio de trabajo todo-en-uno
Piensa en Synapse como una cocina industrial con todos los aparatos en un solo lugar. Antes de Synapse, las empresas necesitaban servicios separados para ingerir, transformar y analizar datos. Synapse unifica todo.
SQL Pool dedicado
Como reservar una mesa en un restaurante — pagas para tenerla disponible siempre. Es un data warehouse aprovisionado con recursos fijos y rendimiento estable.
SQL Pool sin servidor
Como un taxi — pagas solo cuando lo usas. Cobra por consulta, apuntas a datos en Azure Data Lake y ejecutas SQL sin aprovisionar nada.
Pool Apache Spark
Como tener un equipo entero de analistas trabajando en paralelo. Ideal para grandes volumenes de datos, machine learning y analisis exploratorio.
Pipelines integrados
Synapse incluye pipelines integrados con la misma tecnologia que Azure Data Factory.
Azure Databricks — el notebook colaborativo para ciencia de datos
Mientras Synapse es una cocina industrial completa, Databricks es mas como un laboratorio de investigacion colaborativo — donde los cientificos de datos escriben codigo y experimentan en tiempo real.
Delta Lake anade confiabilidad al data lake: transacciones ACID, time travel (ver datos del pasado) y control de calidad de esquemas. Data lake + confiabilidad de base de datos = Delta Lake.
Azure Data Factory — el plomero de datos sin codigo
Piensa en Data Factory como un sistema de plomeria de datos. Conecta mas de 90 fuentes de datos diferentes y mueve datos entre ellas — sin escribir codigo. La interfaz es visual, de arrastrar y soltar.
Usos tipicos: copiar datos de SQL local a Azure, mover archivos de Amazon S3, programar pipelines nocturnos automaticamente.
Microsoft Fabric — la plataforma unificada de nueva generacion
Microsoft Fabric es la vision mas reciente de Microsoft: una plataforma SaaS que unifica ingestacion, transformacion, analytics, ciencia de datos y visualizacion en un solo lugar.
OneLake es su concepto clave: un unico repositorio centralizado para todos los datos de la organizacion. En lugar de datos dispersos en multiples cuentas de almacenamiento, todo esta en un solo lago.
Lakehouse — lo mejor de dos mundos
Un data lake es flexible y barato pero dificil de consultar con SQL. Un data warehouse es rapido para SQL pero caro y solo acepta datos estructurados.
El lakehouse combina ambos: flexibilidad del data lake + capacidad de consulta del warehouse.
| Caracteristica | Data Lake | Data Warehouse | Lakehouse | |---------------|-----------|----------------|-----------| | Tipos de datos | Cualquiera | Solo estructurado | Cualquiera | | Costo | Bajo | Alto | Bajo | | Consultas SQL | Limitado | Excelente | Bueno | | Machine Learning | Excelente | Limitado | Excelente |
Puntos clave para el examen
"Plataforma analitica unificada (SQL + Spark + pipelines)" -- Azure Synapse Analytics "Data warehouse aprovisionado con recursos fijos" -- Synapse Dedicated SQL Pool "Pago por consulta, sin aprovisionamiento" -- Synapse Serverless SQL Pool "Big data y machine learning con Spark" -- Synapse Apache Spark Pool "Notebook colaborativo basado en Spark" -- Azure Databricks "ACID + time travel en el data lake" -- Delta Lake "Pipelines sin codigo, mas de 90 conectores" -- Azure Data Factory "Plataforma SaaS unificada con OneLake" -- Microsoft Fabric "Flexibilidad del lake + estructura del warehouse" -- Lakehouse "Transformar en el destino, gran escala" -- ELT