Servicios de análisis a gran escala

Desde ETL vs ELT hasta Azure Synapse, Databricks, Data Factory y Microsoft Fabric — una guia sencilla sobre analitica de datos a gran escala en Azure.

Imagina que tienes una montana de datos sin procesar — registros de ventas, clics de usuarios, lecturas de sensores — y necesitas convertir todo eso en informacion util. Como hacerlo a gran escala? Este post explica las herramientas de Azure creadas exactamente para eso.

 

ETL vs ELT — en que orden ocurre la transformacion?

Antes de hablar de servicios, necesitas entender dos conceptos fundamentales: ETL y ELT.

Piensa en cocinar como analogia.

Con ETL (Extraer, Transformar, Cargar), lavas, cortas y condimentas los ingredientes antes de ponerlos en la olla. La transformacion ocurre antes de que el dato llegue a su destino final.

Con ELT (Extraer, Cargar, Transformar), metes todo en la olla primero y luego ajustas. La transformacion ocurre dentro del sistema de destino.

| Aspecto | ETL | ELT | |---------|-----|-----| | Orden | Extraer, Transformar, Cargar | Extraer, Cargar, Transformar | | Donde transforma | Servidor intermedio | Sistema de destino | | Mejor para | Pequena escala, transformaciones complejas | Gran escala, destino poderoso |

En Azure, ELT es mas comun porque el sistema de destino (como Synapse) es muy potente.

!ETL vs ELT

Azure Synapse Analytics — el espacio de trabajo todo-en-uno

Piensa en Synapse como una cocina industrial con todos los aparatos en un solo lugar. Antes de Synapse, las empresas necesitaban servicios separados para ingerir, transformar y analizar datos. Synapse unifica todo.

SQL Pool dedicado

Como reservar una mesa en un restaurante — pagas para tenerla disponible siempre. Es un data warehouse aprovisionado con recursos fijos y rendimiento estable.

SQL Pool sin servidor

Como un taxi — pagas solo cuando lo usas. Cobra por consulta, apuntas a datos en Azure Data Lake y ejecutas SQL sin aprovisionar nada.

Pool Apache Spark

Como tener un equipo entero de analistas trabajando en paralelo. Ideal para grandes volumenes de datos, machine learning y analisis exploratorio.

Pipelines integrados

Synapse incluye pipelines integrados con la misma tecnologia que Azure Data Factory.

 

Azure Databricks — el notebook colaborativo para ciencia de datos

Mientras Synapse es una cocina industrial completa, Databricks es mas como un laboratorio de investigacion colaborativo — donde los cientificos de datos escriben codigo y experimentan en tiempo real.

Delta Lake anade confiabilidad al data lake: transacciones ACID, time travel (ver datos del pasado) y control de calidad de esquemas. Data lake + confiabilidad de base de datos = Delta Lake.

 

Azure Data Factory — el plomero de datos sin codigo

Piensa en Data Factory como un sistema de plomeria de datos. Conecta mas de 90 fuentes de datos diferentes y mueve datos entre ellas — sin escribir codigo. La interfaz es visual, de arrastrar y soltar.

Usos tipicos: copiar datos de SQL local a Azure, mover archivos de Amazon S3, programar pipelines nocturnos automaticamente.

 

Microsoft Fabric — la plataforma unificada de nueva generacion

Microsoft Fabric es la vision mas reciente de Microsoft: una plataforma SaaS que unifica ingestacion, transformacion, analytics, ciencia de datos y visualizacion en un solo lugar.

OneLake es su concepto clave: un unico repositorio centralizado para todos los datos de la organizacion. En lugar de datos dispersos en multiples cuentas de almacenamiento, todo esta en un solo lago.

 

Lakehouse — lo mejor de dos mundos

Un data lake es flexible y barato pero dificil de consultar con SQL. Un data warehouse es rapido para SQL pero caro y solo acepta datos estructurados.

El lakehouse combina ambos: flexibilidad del data lake + capacidad de consulta del warehouse.

| Caracteristica | Data Lake | Data Warehouse | Lakehouse | |---------------|-----------|----------------|-----------| | Tipos de datos | Cualquiera | Solo estructurado | Cualquiera | | Costo | Bajo | Alto | Bajo | | Consultas SQL | Limitado | Excelente | Bueno | | Machine Learning | Excelente | Limitado | Excelente |

 

Puntos clave para el examen

"Plataforma analitica unificada (SQL + Spark + pipelines)" -- Azure Synapse Analytics "Data warehouse aprovisionado con recursos fijos" -- Synapse Dedicated SQL Pool "Pago por consulta, sin aprovisionamiento" -- Synapse Serverless SQL Pool "Big data y machine learning con Spark" -- Synapse Apache Spark Pool "Notebook colaborativo basado en Spark" -- Azure Databricks "ACID + time travel en el data lake" -- Delta Lake "Pipelines sin codigo, mas de 90 conectores" -- Azure Data Factory "Plataforma SaaS unificada con OneLake" -- Microsoft Fabric "Flexibilidad del lake + estructura del warehouse" -- Lakehouse "Transformar en el destino, gran escala" -- ELT

Volver a la lista del blog