Guía Completa de Integración de Datos y Pipelines de Análisis

Data Factory, Synapse Analytics, Event Hubs, Stream Analytics — servicios del AZ-305 comparados por escenario: Integration Runtime, arquitectura lambda y más.

La integración de datos y los pipelines de análisis representan una parte significativa del examen AZ-305. No basta con memorizar los nombres de los servicios: necesitas distinguir con precisión qué servicio encaja en cada escenario. Desde pipelines ETL on-premises hasta streaming en tiempo real que procesa millones de eventos por segundo, esta guía recorre los servicios clave y los criterios de selección basándose en 29 patrones de escenarios del examen.

---

 

Data Factory y Pipelines ETL/ELT

Azure Data Factory (ADF) es un servicio ETL/ELT completamente administrado que permite construir pipelines de datos de forma visual sin escribir código. Ofrece más de 80 conectores que abarcan bases de datos on-premises como SQL Server, MySQL y Oracle, así como almacenamiento en la nube como Blob Storage, Azure Data Lake Storage Gen2 y Cosmos DB.

ADF tiene tres componentes centrales. Copy Activity copia datos de un origen a un destino e incluye mapeo de columnas y conversión de formato integrados. Mapping Data Flow permite definir filtros, agregaciones y joins mediante una interfaz de arrastrar y soltar, sin escribir código, y los ejecuta en un clúster Spark interno. Integration Runtime (IR) es la infraestructura de cómputo que mueve los datos en la práctica; existen tres tipos: Azure IR, Self-hosted Integration Runtime (SHIR) y Azure-SSIS IR.

Cuando necesitas acceder a un servidor on-premises detrás de un firewall, el Self-hosted Integration Runtime (SHIR) es obligatorio. Es un agente instalado en el servidor on-premises que se comunica con ADF únicamente a través de HTTPS saliente — sin necesidad de abrir puertos de entrada. En el examen, cuando encuentres condiciones como "on-premises detrás de un firewall" o "servidor local sin conectividad a internet", el SHIR es el núcleo de la respuesta correcta.

Si tienes cientos de paquetes SSIS existentes y quieres ejecutarlos en Azure sin reescribirlos, usa Azure-SSIS IR. Despliega los paquetes en SSISDB y ejecútalos exactamente como antes usando la actividad Execute SSIS Package en un pipeline de ADF.

ADF admite triggers de programación, triggers de eventos y triggers de ventana de tiempo (tumbling window). Incluye políticas de reintento integradas y un hub de monitoreo, lo que mantiene bajo el overhead operativo. Para la ingesta incremental, puedes usar un enfoque basado en watermark o Change Data Capture para extraer selectivamente solo los datos nuevos o modificados.

---

 

Synapse Analytics y el Data Warehouse

Azure Synapse Analytics es un servicio unificado que combina el data warehouse y el análisis de big data en una sola plataforma. Dentro de Synapse Analytics existen tres motores de análisis principales.

El primero es el Dedicated SQL Pool. Utiliza una arquitectura MPP (Procesamiento Masivo en Paralelo) que distribuye las consultas entre 60 nodos distribuidos en paralelo. Es la opción óptima para escenarios de data warehouse a gran escala donde cientos de usuarios ejecutan consultas de agregación de forma concurrente. Elegir una clave de distribución Hash basada en columnas que se usan frecuentemente en joins y agregaciones minimiza el movimiento de datos entre nodos (tráfico DMS) y maximiza el rendimiento de las consultas.

El segundo es el Serverless SQL Pool. Permite consultar directamente con T-SQL archivos Parquet, CSV y JSON almacenados en Azure Data Lake Storage Gen2, sin infraestructura que gestionar. La facturación es por consulta ejecutada, lo que lo hace rentable para análisis exploratorio ad hoc.

El tercero es el Synapse Spark Pool. Gestiona transformaciones complejas y pipelines de ML escritos en Python, Scala o R, y se integra con Delta Lake para transacciones ACID (upsert/delete). La función auto-pause lleva el costo a cero automáticamente cuando no hay trabajo activo.

Los workspaces de Synapse Analytics también incluyen Synapse Pipelines como característica integrada. Comparten la misma base de código que ADF y ofrecen más de 400 conectores. Elige ADF independiente cuando necesites un servicio ETL autónomo; elige Synapse Pipelines cuando quieras una gestión integrada dentro de un workspace de Synapse existente. Para descargar la capa semántica de Power BI, agrega Azure Analysis Services sobre Synapse — esto evita que miles de usuarios de BI simultáneos carguen directamente el Dedicated SQL Pool.

---

 

Mensajería y Eventos: Event Hubs, Event Grid, Service Bus

Estos tres servicios parecen similares por su nombre, pero sus filosofías de diseño son fundamentalmente diferentes.

Azure Event Hubs es un servicio diseñado específicamente para la ingesta de flujos de eventos de alto volumen. Almacena en búfer millones de eventos por segundo de forma confiable, y los consumidores leen a su propio ritmo, de manera independiente entre sí. Su arquitectura paralela basada en particiones desacopla completamente la capa de ingesta de la capa de procesamiento, y los eventos se conservan durante un período de retención configurable de hasta 90 días. Con Event Hubs Capture, los eventos se archivan automáticamente en Azure Data Lake Storage Gen2 en formato Apache Avro, listos para análisis batch en el cold path.

Azure Event Grid enruta los eventos de recursos de Azure mediante un modelo de publicación-suscripción. Es adecuado para eventos de notificación como la carga de archivos en Blob o cambios en el estado de los recursos, con baja latencia y amplia integración en los servicios de Azure.

Azure Service Bus es un broker de mensajería empresarial optimizado para la entrega de mensajes asíncrona y confiable. Admite dos patrones: Queue y Topic/Subscription.

Una Queue sigue el patrón de consumidor competitivo — exactamente un receptor procesa cada mensaje. Es la elección correcta para escenarios que requieren integridad transaccional y cero pérdida de mensajes. La función Session garantiza que los mensajes que comparten el mismo SessionId siempre sean procesados en orden por la misma instancia del consumidor, lo cual es valioso para flujos de trabajo sensibles al orden, como las reservas de boletos de avión.

Topic/Subscription implementa el patrón Publish-Subscribe. Cuando se publica un mensaje en un topic, cada suscripción mantiene una copia independiente para que varios consumidores puedan recibirlo a su propio ritmo. También puedes agregar reglas de filtro para que cada suscripción reciba solo los mensajes que coincidan con condiciones específicas.

---

 

Análisis en Tiempo Real: Stream Analytics y Databricks

Azure Stream Analytics es un servicio completamente administrado que aplica consultas similares a SQL sobre flujos de eventos para el análisis en tiempo real. Procesa agregaciones, filtros y joins en flujos provenientes de Event Hubs o IoT Hub, y escribe los resultados al instante en Power BI, SQL Database, Cosmos DB y más. Sin servidores que aprovisionar — escalas la capacidad de procesamiento con Streaming Units (SU).

Azure Databricks es una plataforma de análisis administrada construida sobre Apache Spark. Admite procesamiento batch a gran escala, entrenamiento de modelos de ML y procesamiento en tiempo real mediante Structured Streaming — todo en un solo lugar. Es la opción adecuada cuando necesitas lógica de transformación compleja, pipelines de ML personalizados o integración profunda con bibliotecas de código abierto.

Azure Data Explorer está diseñado para el procesamiento con latencia ultrabaja de logs de texto y datos de series temporales a escala de petabytes. Usa KQL (Kusto Query Language) y destaca en escenarios donde cientos de analistas ejecutan consultas interactivas de forma simultánea — el análisis de logs de seguridad y la detección de patrones en tráfico de red son ejemplos paradigmáticos.

Para resumir los criterios de selección: usa Stream Analytics para la agregación SQL en tiempo real y la salida inmediata a dashboards; usa Databricks para código ML/Spark complejo y pipelines que combinan batch y streaming; usa Azure Data Explorer para la exploración interactiva de datos de logs y series temporales.

---

 

Tablas Comparativas de Servicios

| Atributo | Event Hubs | Event Grid | Service Bus | |----------|-----------|-----------|-------------| | Uso principal | Ingesta de flujos de eventos de alto volumen | Enrutamiento de eventos y notificaciones | Mensajería asíncrona confiable | | Modelo | Streaming (pull basado en particiones) | Pub-Sub push de eventos | Queue / Topic+Subscription | | Retención de mensajes | Hasta 90 días (retenidos tras el consumo) | Expira tras reintento de 24 horas | Se elimina tras el procesamiento exitoso | | Throughput | Millones de eventos/seg | Hasta decenas de millones de eventos/seg | Miles de mensajes/seg | | Garantía de orden | Ordenado dentro de una partición | Sin garantía | Ordenado mediante la función Session | | Escenario típico | Telemetría IoT, ingesta de logs de auditoría | Notificaciones de carga de archivos, cambios de recursos | Procesamiento de órdenes, mensajería de flujo de trabajo |

| Atributo | Azure Data Factory | Synapse Pipelines | |----------|------------------|-----------------| | Independencia | Servicio ETL independiente | Integrado en el workspace de Synapse | | Base de código | Idéntica (compartida) | Idéntica (compartida) | | Conectores | 90+ | 400+ (basado en ADF) | | Cuándo elegir | Cuando necesitas una herramienta ETL autónoma | Cuando integras dentro de un entorno Synapse existente |

---

 

Criterios de Selección que Suelen Confundir a los Candidatos

Escenario 1 — Acceder a un servidor on-premises detrás de un firewall: El Self-hosted IR es obligatorio. Se comunica con ADF a través de HTTPS saliente únicamente, sin abrir puertos de entrada.

Escenario 2 — Varios consumidores reciben el mismo mensaje a su propio ritmo: Service Bus Topic/Subscription. Cada suscripción mantiene una copia independiente del mensaje, y las reglas de filtro permiten la recepción selectiva. Event Hubs está diseñado para la ingesta de streams, y

Volver a la lista del blog