AZ-305 시험에서 데이터 통합과 분석 파이프라인은 전체 출제 범위의 상당한 비중을 차지합니다. 단순히 서비스 이름을 외우는 것으로는 부족하고, 각 서비스가 어떤 시나리오에 어울리는지 경계를 정확히 구분하는 능력이 요구됩니다. 온프레미스 ETL 파이프라인부터 초당 수백만 건의 이벤트를 처리하는 실시간 스트리밍까지 — 29개 시험 문제 시나리오를 바탕으로 핵심 서비스와 선택 기준을 살펴봅니다.
---
Data Factory와 ETL/ELT 파이프라인
Azure Data Factory(ADF)는 코드 없이 시각적으로 데이터 파이프라인을 구성할 수 있는 완전 관리형 ETL/ELT 서비스입니다. 80개 이상의 커넥터를 제공하며 SQL Server, MySQL, Oracle 등 온프레미스 데이터베이스부터 Blob Storage, ADLS Gen2, Cosmos DB 같은 클라우드 저장소까지 폭넓게 연결합니다.
ADF의 핵심 구성 요소는 세 가지입니다. Copy Activity는 원본에서 대상으로 데이터를 복사하며 기본 열 매핑·형식 변환을 내장합니다. Mapping Data Flow는 드래그앤드롭 인터페이스에서 필터링, 집계, 조인을 코드 없이 정의하고 내부 Spark에서 실행합니다. Integration Runtime(IR)은 데이터를 실제로 이동하는 컴퓨팅 인프라로, Azure IR, Self-hosted IR, Azure-SSIS IR 세 종류가 있습니다.
방화벽 내부의 온프레미스 서버에 접근하려면 Self-hosted Integration Runtime(SHIR)이 필수입니다. 온프레미스 서버에 설치되는 에이전트로 인바운드 포트 없이 아웃바운드 HTTPS 연결만으로 ADF와 통신합니다. 시험에서 "방화벽 내부 온프레미스", "인터넷 미연결 로컬 서버"라는 조건이 나오면 SHIR이 정답의 핵심입니다.
기존에 수백 개의 SSIS 패키지가 있고 이것을 재작성 없이 Azure에서 실행하고 싶다면 Azure-SSIS IR을 사용합니다. 패키지를 SSISDB에 배포하고 ADF 파이프라인의 Execute SSIS Package 액티비티로 기존과 동일하게 실행할 수 있습니다.
ADF는 스케줄 트리거, 이벤트 트리거, 텀블링 윈도우 트리거를 지원합니다. 실패 시 재시도 정책과 모니터링 허브를 내장하고 있어 운영 오버헤드가 낮습니다. 증분 수집이 필요한 경우 워터마크(watermark) 기반 또는 Change Data Capture 방식으로 신규·변경 데이터만 선택적으로 수집합니다.
---
Synapse Analytics와 데이터 웨어하우징
Azure Synapse Analytics는 데이터 웨어하우스와 빅데이터 분석을 하나의 플랫폼에서 제공하는 통합 서비스입니다. Synapse Analytics 안에는 크게 세 가지 분석 엔진이 있습니다.
첫 번째는 Dedicated SQL Pool(전용 SQL 풀)입니다. MPP(대규모 병렬 처리) 아키텍처로 쿼리를 60개 분산 노드에 병렬 분배합니다. 수백 명이 동시에 집계 쿼리하는 대규모 데이터 웨어하우스 시나리오에 최적입니다. Hash 분산 키를 조인·집계에 자주 쓰이는 컬럼으로 설정하면 노드 간 데이터 이동(DMS 트래픽)이 최소화되어 쿼리 성능이 극대화됩니다.
두 번째는 Serverless SQL Pool입니다. ADLS Gen2의 Parquet, CSV, JSON 파일을 인프라 관리 없이 T-SQL로 직접 쿼리하며, 실행 쿼리양에 따라 과금되어 간헐적 탐색 분석에 유리합니다.
세 번째는 Synapse Spark Pool입니다. Python/Scala/R 기반 복잡한 변환과 ML 파이프라인에 사용하며, Delta Lake와 통합되어 ACID 트랜잭션(upsert/delete)을 지원합니다. auto-pause로 작업이 없을 때 비용이 자동으로 0이 됩니다.
Synapse Analytics 워크스페이스에는 Synapse 파이프라인도 내장되어 있습니다. ADF와 동일한 코드 기반으로 400개 이상의 커넥터를 공유합니다. 독립적인 ETL 서비스가 필요하면 ADF, Synapse 워크스페이스 내 통합 관리를 원하면 Synapse 파이프라인입니다. Power BI 시맨틱 계층을 분리하려면 Azure Analysis Services를 Synapse 위에 추가하면 수천 명 동시 접속에도 전용 풀에 직접 부하를 주지 않습니다.
---
메시징과 이벤트: Event Hubs, Event Grid, Service Bus
세 서비스는 이름만 보면 비슷해 보이지만 설계 철학이 근본적으로 다릅니다.
Azure Event Hubs는 대용량 이벤트 스트리밍 수집에 특화된 서비스입니다. 초당 수백만 건의 이벤트를 안정적으로 버퍼링하고, 소비자가 처리 속도에 맞춰 독립적으로 읽어갑니다. Partition 기반 병렬 구조로 수집 계층과 처리 계층을 완전히 분리할 수 있고, 이벤트는 보존 기간(최대 90일) 동안 유지됩니다. Event Hubs Capture를 사용하면 이벤트를 Apache Avro 형식으로 ADLS Gen2에 자동 저장하여 cold path 배치 분석에 활용할 수 있습니다.
Azure Event Grid는 Azure 리소스 이벤트를 발행-구독 방식으로 라우팅합니다. Blob 파일 업로드나 리소스 상태 변경 같은 알림 이벤트 처리에 적합하며, 낮은 지연과 광범위한 Azure 서비스 연동이 강점입니다.
Azure Service Bus는 신뢰성 있는 비동기 메시지 전달에 최적화된 엔터프라이즈 메시지 브로커로, 큐(Queue)와 토픽/구독(Topic/Subscription) 두 패턴을 지원합니다.
큐(Queue)는 하나의 메시지를 정확히 하나의 수신자만 처리하는 경쟁 소비자 패턴입니다. 트랜잭션 무결성과 메시지 유실 방지가 필요한 시나리오에 적합합니다. 세션 기능을 사용하면 동일 SessionId의 메시지가 항상 같은 소비자 인스턴스에서 순서대로 처리되어, 항공권 예약처럼 순서가 치명적인 경우에 활용됩니다.
토픽/구독(Topic/Subscription)은 Publish-Subscribe 패턴입니다. 하나의 토픽에 메시지를 발행하면 각 구독이 독립적인 복사본을 유지하여 여러 소비자가 각자의 속도로 수신합니다. 필터 규칙으로 조건에 맞는 메시지만 선택적으로 구독할 수도 있습니다.
---
실시간 분석: Stream Analytics와 Databricks
Azure Stream Analytics는 이벤트 스트림에 SQL 유사 쿼리를 적용하여 실시간 분석을 수행하는 완전 관리형 서비스입니다. Event Hubs나 IoT Hub에서 들어오는 스트림에 집계, 필터, 조인을 실시간으로 적용하고 결과를 Power BI, SQL Database, Cosmos DB 등에 즉시 출력합니다. 서버를 프로비저닝하지 않아도 되고 스트리밍 유닛(SU)으로 처리 용량을 조절합니다.
Azure Databricks는 Apache Spark 기반의 관리형 분석 플랫폼으로, 대규모 배치 처리, ML 모델 학습, Structured Streaming 기반 실시간 처리를 모두 지원합니다. 복잡한 변환 로직, 커스텀 ML 파이프라인, 오픈소스 라이브러리 통합이 필요한 경우에 적합합니다.
Azure Data Explorer는 페타바이트 규모의 텍스트 기반 로그와 시계열 데이터를 초저지연으로 처리하도록 설계된 서비스입니다. KQL(Kusto Query Language)을 사용하며, 수백 명의 분석가가 동시에 대화형 쿼리를 실행하는 보안 로그 분석, 네트워크 트래픽 패턴 탐지 시나리오에서 강점을 발휘합니다.
선택 기준을 정리하면, 실시간 SQL 집계와 즉시 대시보드 출력에는 Stream Analytics, 복잡한 ML/Spark 코드와 배치+스트리밍 통합에는 Databricks, 로그·시계열 데이터의 대화형 탐색에는 Azure Data Explorer입니다.
---
서비스 비교표
| 항목 | Event Hubs | Event Grid | Service Bus | |------|-----------|-----------|------------| | 주요 용도 | 대용량 이벤트 스트리밍 수집 | 이벤트 라우팅·알림 | 신뢰성 있는 비동기 메시징 | | 모델 | 스트리밍 (Partition 기반 pull) | Pub-Sub 이벤트 (push) | Queue / Topic+Subscription | | 메시지 보존 | 최대 90일 (소비 후에도 보존) | 24시간 재시도 후 만료 | 처리 완료 후 삭제 | | 처리량 | 수백만 이벤트/초 | 수천만 이벤트/초까지 | 수천 메시지/초 | | 순서 보장 | 파티션 내 순서 보장 | 보장 없음 | 세션 기능으로 순서 보장 | | 대표 시나리오 | IoT 원격 측정, 감사 로그 수집 | 파일 업로드 알림, 리소스 변경 | 주문 처리, 워크플로 메시징 |
| 항목 | Azure Data Factory | Synapse 파이프라인 | |------|------------------|-----------------| | 독립성 | 독립 ETL 서비스 | Synapse 워크스페이스 내장 | | 코드 기반 | 동일 (공유) | 동일 (공유) | | 커넥터 | 90개 이상 | 400개 이상 (ADF 기반) | | 선택 기준 | 독립적 ETL 도구가 필요할 때 | 기존 Synapse 환경 내 통합 시 |
---
시험에서 자주 헷갈리는 선택 기준
시나리오 1 — 방화벽 내부 온프레미스 서버 접근: Self-hosted IR이 필수입니다. 인바운드 포트 개방 없이 아웃바운드 HTTPS 연결만으로 ADF와 통신합니다.
시나리오 2 — 여러 소비자가 동일 메시지를 각자의 속도로 수신: Service Bus Topic/Subscription입니다. 구독별로 독립적인 메시지 복사본을 유지하며 필터로 선택적 수신도 가능합니다. Event Hubs는 스트리밍 수집이 목적이고, Queue는 단일 소비자 전용입니다.
시나리오 3 — 200TB를 제한된 대역폭으로 이전: Azure Data Box(물리 디바이스)를 사용합니다. 이전 후 증분 동기화는 AzCopy로 처리합니다.
시나리오 4 — SSIS 패키지 재작성 없이 Azure 실행: ADF의 Azure-SSIS IR이 유일한 방법입니다.
시나리오 5 — MPP 집계 vs 로그 대화형 탐색: 수백 명 동시 집계는 Synapse Dedicated SQL Pool, 페타바이트 로그 대화형 탐색은 Azure Data Explorer(KQL)입니다.
---
실무 적용 팁
데이터 파이프라인에서는 hot path(실시간)와 cold path(배치)를 분리하는 람다 아키텍처가 자주 등장합니다. Event Hubs가 이벤트를 수집하면 Stream Analytics가 hot path 실시간 집계를 처리하고, Event Hubs Capture가 ADLS Gen2에 Avro로 자동 저장합니다. 이후 ADF나 Synapse 파이프라인이 배치로 정제·변환하여 Synapse Dedicated SQL Pool에 적재하는 흐름이 전형적입니다.
Integration Runtime 세 종류를 명확히 구분하세요. Azure IR은 클라우드 간 이동을 ADF가 관리하고, Self-hosted IR은 온프레미스 서버에 설치해 방화벽 내부 접근을 담당하며, Azure-SSIS IR은 기존 SSIS 패키지를 재작성 없이 실행합니다.
Delta Lake는 Synapse Spark Pool에서 upsert/delete와 ML 파이프라인 재사용이 동시에 필요할 때 선택합니다. On-premises Data Gateway는 Logic Apps 전용으로, VPN 없이 온프레미스 SQL Server에 접근할 때 온프레미스에 소프트웨어 설치 후 Azure 포털에서 gateway 리소스를 별도 생성해 연결합니다.
---
정리
AZ-305 데이터 통합 파이프라인 문제에서 다음 키워드 매핑을 즉시 떠올리세요.
"방화벽 내부 온프레미스 접근" → Self-hosted Integration Runtime "SSIS 패키지 재사용" → Azure-SSIS Integration Runtime "코드 없는 시각적 변환" → ADF Mapping Data Flow "기존 Synapse 환경 내 파이프라인" → Synapse 파이프라인 (ADF와 코드 기반 동일) "초당 수천~수백만 이벤트 수집 + 버퍼링" → Event Hubs "하나의 이벤트를 여러 소비자가 독립 수신" → Service Bus Topic/Subscription "단일 소비자, 트랜잭션 무결성" → Service Bus Queue "MPP, 수백 명 동시 집계" → Synapse Dedicated SQL Pool "페타바이트 로그, 대화형 KQL 쿼리" → Azure Data Explorer "Spark + ACID 트랜잭션 + ML 재사용" → Delta Lake on Synapse Spark
각 서비스 경계를 명확히 이해하고 키워드에 반응하는 훈련을 쌓으면, 이 도메인의 문제들은 반드시 득점으로 연결됩니다.