Guia Completo de Integração de Dados e Pipelines de Análise

Data Factory, Synapse Analytics, Event Hubs, Stream Analytics — serviços do AZ-305 comparados por cenário, do Integration Runtime à arquitetura lambda.

A integração de dados e os pipelines de análise representam uma parcela significativa do exame AZ-305. Memorizar apenas os nomes dos serviços não é suficiente — você precisa distinguir com precisão qual serviço se encaixa em cada cenário. De pipelines ETL on-premises ao streaming em tempo real que processa milhões de eventos por segundo, este guia percorre os serviços principais e os critérios de seleção com base em 29 padrões de cenários do exame.

---

 

Data Factory e Pipelines ETL/ELT

Azure Data Factory (ADF) é um serviço ETL/ELT totalmente gerenciado que permite construir pipelines de dados visualmente, sem escrever código. Ele oferece mais de 80 conectores que abrangem bancos de dados on-premises como SQL Server, MySQL e Oracle, além de armazenamento em nuvem como Blob Storage, Azure Data Lake Storage Gen2 e Cosmos DB.

O ADF possui três componentes centrais. O Copy Activity copia dados de uma origem para um destino e inclui mapeamento de colunas e conversão de formato integrados. O Mapping Data Flow permite definir filtros, agregações e joins por meio de uma interface de arrastar e soltar, sem escrever código, executando-os em um cluster Spark interno. O Integration Runtime (IR) é a infraestrutura de computação que efetivamente move os dados; existem três tipos: Azure IR, Self-hosted Integration Runtime (SHIR) e Azure-SSIS IR.

Quando você precisa acessar um servidor on-premises atrás de um firewall, o Self-hosted Integration Runtime (SHIR) é obrigatório. Trata-se de um agente instalado no servidor on-premises que se comunica com o ADF apenas via HTTPS de saída — sem necessidade de abrir portas de entrada. No exame, sempre que encontrar condições como "on-premises atrás de um firewall" ou "servidor local sem conectividade à internet", o SHIR é o núcleo da resposta correta.

Se você tem centenas de pacotes SSIS existentes e quer executá-los no Azure sem reescrevê-los, use o Azure-SSIS IR. Implante os pacotes no SSISDB e execute-os exatamente como antes, usando a atividade Execute SSIS Package em um pipeline do ADF.

O ADF suporta gatilhos de agendamento, gatilhos de eventos e gatilhos de janela deslizante (tumbling window). Ele vem com políticas de repetição integradas e um hub de monitoramento, mantendo o overhead operacional baixo. Para ingestão incremental, você pode usar uma abordagem baseada em watermark ou Change Data Capture para extrair seletivamente apenas os dados novos ou alterados.

---

 

Synapse Analytics e Data Warehousing

Azure Synapse Analytics é um serviço unificado que combina data warehouse e análise de big data em uma única plataforma. Dentro do Synapse Analytics existem três principais mecanismos analíticos.

O primeiro é o Dedicated SQL Pool. Ele usa uma arquitetura MPP (Processamento Massivamente Paralelo) que distribui as consultas entre 60 nós distribuídos em paralelo. É a escolha ideal para cenários de data warehouse em grande escala, onde centenas de usuários executam consultas de agregação simultaneamente. Escolher uma chave de distribuição Hash com base em colunas usadas frequentemente em joins e agregações minimiza o movimento de dados entre nós (tráfego DMS) e maximiza o desempenho das consultas.

O segundo é o Serverless SQL Pool. Ele permite consultar diretamente com T-SQL arquivos Parquet, CSV e JSON armazenados no Azure Data Lake Storage Gen2, sem infraestrutura para gerenciar. A cobrança é por consulta executada, o que o torna econômico para análises exploratórias ad hoc.

O terceiro é o Synapse Spark Pool. Ele lida com transformações complexas e pipelines de ML escritos em Python, Scala ou R, e se integra com Delta Lake para transações ACID (upsert/delete). O auto-pause reduz o custo a zero automaticamente quando não há trabalho ativo.

Os workspaces do Synapse Analytics também incluem o Synapse Pipelines como recurso integrado. Eles compartilham a mesma base de código que o ADF e oferecem mais de 400 conectores. Escolha o ADF autônomo quando precisar de um serviço ETL independente; escolha o Synapse Pipelines quando quiser gerenciamento integrado dentro de um workspace Synapse existente. Para descarregar a camada semântica do Power BI, adicione o Azure Analysis Services sobre o Synapse — isso evita que milhares de usuários de BI simultâneos carreguem diretamente o Dedicated SQL Pool.

---

 

Mensageria e Eventos: Event Hubs, Event Grid, Service Bus

Esses três serviços parecem similares pelo nome, mas suas filosofias de design são fundamentalmente diferentes.

Azure Event Hubs é um serviço criado especificamente para ingestão de fluxos de eventos de alto volume. Ele armazena em buffer milhões de eventos por segundo de forma confiável, e os consumidores leem no próprio ritmo, de forma independente entre si. Sua arquitetura paralela baseada em partições desacopla completamente a camada de ingestão da camada de processamento, e os eventos são retidos por um período de retenção configurável de até 90 dias. Com o Event Hubs Capture, os eventos são automaticamente arquivados no Azure Data Lake Storage Gen2 no formato Apache Avro, prontos para análise batch no cold path.

Azure Event Grid roteia eventos de recursos do Azure usando um modelo de publicação-assinatura. É adequado para eventos de notificação como uploads de arquivos no Blob ou alterações de estado de recursos, com baixa latência e ampla integração com os serviços do Azure.

Azure Service Bus é um broker de mensagens empresarial otimizado para entrega de mensagens assíncrona e confiável. Ele suporta dois padrões: Queue e Topic/Subscription.

Uma Queue segue o padrão de consumidor concorrente — exatamente um receptor processa cada mensagem. É a escolha certa para cenários que exigem integridade transacional e zero de perda de mensagens. O recurso Session garante que mensagens com o mesmo SessionId sejam sempre processadas em ordem pela mesma instância do consumidor, o que é valioso para fluxos de trabalho sensíveis à ordem, como reservas de passagens aéreas.

Topic/Subscription implementa o padrão Publish-Subscribe. Quando uma mensagem é publicada em um topic, cada assinatura mantém uma cópia independente para que vários consumidores possam recebê-la no próprio ritmo. Você também pode adicionar regras de filtro para que cada assinatura receba apenas as mensagens que correspondam a condições específicas.

---

 

Análise em Tempo Real: Stream Analytics e Databricks

Azure Stream Analytics é um serviço totalmente gerenciado que aplica consultas semelhantes a SQL em fluxos de eventos para análise em tempo real. Ele processa agregações, filtros e joins em fluxos provenientes do Event Hubs ou do IoT Hub, e escreve os resultados imediatamente no Power BI, SQL Database, Cosmos DB e outros destinos. Sem servidores para provisionar — você escala a capacidade de processamento com Streaming Units (SU).

Azure Databricks é uma plataforma de análise gerenciada construída sobre o Apache Spark. Ela suporta processamento batch em grande escala, treinamento de modelos de ML e processamento em tempo real via Structured Streaming — tudo em um só lugar. É a opção certa quando você precisa de lógica de transformação complexa, pipelines de ML personalizados ou integração profunda com bibliotecas de código aberto.

Azure Data Explorer foi projetado para processamento com latência ultrabaixa de logs de texto e dados de séries temporais em escala de petabytes. Ele usa KQL (Kusto Query Language) e se destaca em cenários onde centenas de analistas executam consultas interativas simultaneamente — análise de logs de segurança e detecção de padrões em tráfego de rede são exemplos clássicos.

Para resumir os critérios de seleção: use Stream Analytics para agregação SQL em tempo real e saída imediata para dashboards; use Databricks para código ML/Spark complexo e pipelines que combinam batch e streaming; use Azure Data Explorer para exploração interativa de dados de logs e séries temporais.

---

 

Tabelas Comparativas de Serviços

| Atributo | Event Hubs | Event Grid | Service Bus | |----------|-----------|-----------|-------------| | Uso principal | Ingestão de fluxos de eventos de alto volume | Roteamento de eventos e notificações | Mensageria assíncrona confiável | | Modelo | Streaming (pull baseado em partições) | Pub-Sub push de eventos | Queue / Topic+Subscription | | Retenção de mensagens | Até 90 dias (retidas após o consumo) | Expira após tentativa de 24 horas | Excluída após processamento bem-sucedido | | Throughput | Milhões de eventos/seg | Até dezenas de milhões de eventos/seg | Milhares de mensagens/seg | | Garantia de ordem | Ordenado dentro de uma partição | Sem garantia | Ordenado via recurso Session | | Cenário típico | Telemetria IoT, ingestão de logs de auditoria | Notificações de upload de arquivos, alterações de recursos | Processamento de pedidos, mensageria de fluxo de trabalho |

| Atributo | Azure Data Factory | Synapse Pipelines | |----------|------------------|-----------------| | Independência | Serviço ETL autônomo | Integrado ao workspace do Synapse | | Base de código | Idêntica (compartilhada) | Idêntica (compartilhada) | | Conectores | 90+ | 400+ (baseado em ADF) | | Quando escolher | Quando você precisa de uma ferramenta ETL autônoma | Quando integra dentro de um ambiente Synapse existente |

---

 

Critérios de Seleção que Costumam Confundir os Candidatos

Cenário 1 — Acessar um servidor on-premises atrás de um firewall: O Self-hosted IR é obrigatório. Ele se comunica com o ADF apenas via HTTPS de saída, sem abrir portas de entrada.

Cenário 2 — Vários consumidores recebendo a mesma mensagem no próprio ritmo: Service Bus Topic/Subscription. Cada assinatura mantém uma cópia independente da mensagem, e as regras de filtro permitem o recebimento seletivo. O Event Hubs é projetado para ingestão de streams, e uma Queue atende apenas um consumidor de cada vez.

Cenário 3 — Migrar 200 TB com largura de banda limitada: Use o Azure Data Box (um dispositivo físico). Gerencie a sin

Voltar à lista do blog