산더미처럼 쌓인 원시 데이터 — 판매 기록, 사용자 클릭 로그, 센서 측정값 — 를 유용한 정보로 바꾸려면 어떻게 해야 할까요? 이 글에서는 Azure가 제공하는 대규모 데이터 분석 도구들을 초보자도 이해할 수 있도록 설명합니다.
ETL과 ELT — 왜 중요한가요?
서비스를 이야기하기 전에 먼저 두 가지 핵심 개념인 ETL과 ELT를 이해해야 합니다. 이 두 용어는 데이터를 수집하고, 변환하고, 저장하는 순서를 설명합니다.
레스토랑 주방에 비유해 보겠습니다.
ETL(Extract, Transform, Load) 방식에서는 재료를 씻고, 자르고, 양념한 뒤에 냄비에 넣습니다. 즉 데이터가 최종 저장소에 도착하기 전에 변환이 이루어집니다.
ELT(Extract, Load, Transform) 방식에서는 모든 재료를 먼저 냄비에 넣고, 그 다음에 조리합니다 — 물기를 빼고, 양념을 조절하는 과정이 저장소 안에서 진행됩니다.
| 구분 | ETL | ELT | |------|-----|-----| | 순서 | 추출 → 변환 → 적재 | 추출 → 적재 → 변환 | | 변환 위치 | 중간 서버 | 목적지 시스템 내부 | | 적합한 경우 | 소규모 데이터, 복잡한 변환 | 대규모 데이터, 강력한 목적지 시스템 | | Azure 예시 | 클래식 처리 방식 | Azure Synapse Analytics |
Azure에서는 목적지 시스템(Azure Synapse 등)이 매우 강력하기 때문에 ELT 방식이 더 일반적입니다. 변환 작업을 목적지에서 직접 수행할 수 있으므로 별도의 중간 서버가 필요 없습니다.
!ETL vs ELT
Azure Synapse Analytics — 올인원 분석 플랫폼
Azure Synapse Analytics를 대규모 분석 작업 공간이라고 생각해 보세요. 산업용 주방에 가스레인지, 오븐, 믹서, 블렌더가 한 곳에 모여 있는 것처럼, 데이터 수집·변환·분석에 필요한 모든 도구가 한 플랫폼에 들어 있습니다.
Synapse 이전에는 기업들이 데이터 수집, 변환, 분석을 위해 각각 다른 서비스를 사용해야 했습니다. Synapse는 이 모든 것을 하나로 통합합니다.
Dedicated SQL Pool (전용 SQL 풀)
레스토랑에서 예약석을 확보하는 것과 같습니다. 자리를 사용하지 않는 시간에도 비용을 지불하지만, 항상 자리가 준비되어 있죠. Dedicated SQL Pool은 고정 리소스가 할당된 프로비저닝 방식의 데이터 웨어하우스로, 안정적이고 예측 가능한 성능을 제공합니다.
사용 시기: 쿼리가 자주 실행되고 높은 부하가 예상될 때. 리소스가 전용이므로 성능이 보장됩니다.
Serverless SQL Pool (서버리스 SQL 풀)
택시를 떠올려 보세요. 자가용을 보유할 필요 없이 탈 때만 요금을 내면 됩니다. Serverless SQL Pool은 쿼리 단위로 과금됩니다. Azure Data Lake에 저장된 데이터를 직접 가리키고 SQL을 실행하면 되며, 별도의 프로비저닝이 필요 없습니다.
사용 시기: 데이터를 가끔 탐색하거나 워크로드가 불규칙할 때. 선불 결제가 없습니다.
Apache Spark Pool
Apache Spark는 분석가 팀 전체가 동시에 병렬로 작업하는 것과 같습니다. 다음과 같은 작업에 적합합니다: 테라바이트~페타바이트 규모의 대용량 데이터 처리 머신 러닝 모델 학습 빅 데이터 탐색 분석
통합 파이프라인
Synapse에는 Azure Data Factory와 동일한 기술 기반의 파이프라인이 내장되어 있습니다. 플랫폼을 벗어나지 않고도 어디에서든 데이터를 Synapse 안으로 이동할 수 있습니다.
Azure Databricks — 데이터 과학자를 위한 협업 노트북
Synapse가 모든 장비를 갖춘 산업용 주방이라면, Databricks는 협업 연구실에 가깝습니다. 데이터 과학자들이 코드를 작성하고, 실험하고, 결과를 실시간으로 공유하는 공간입니다.
Databricks는 Apache Spark 기반으로 구축되어 있으며, 데이터 과학 및 머신 러닝 엔지니어링 팀에서 특히 많이 사용됩니다.
Delta Lake란?
데이터 레이크가 수천 장의 사진이 정리 없이 폴더 하나에 쌓여 있는 사진 아카이브라고 상상해 보세요. Delta Lake는 이 아카이브에 구조와 신뢰성을 더해 줍니다:
ACID 트랜잭션: 데이터가 일관되게 기록됩니다 (쓰기 도중 데이터가 손상되지 않음) Time Travel (시간 여행): 과거 어느 시점의 데이터 상태든 되돌아가서 확인할 수 있음 데이터 품질: 스키마 강제 적용으로 잘못된 형식의 데이터가 레이크에 유입되는 것을 방지
한마디로: 데이터 레이크 + 데이터베이스 수준의 신뢰성 = Delta Lake입니다.
Azure Data Factory — 코드 없이 만드는 데이터 배관
Azure Data Factory를 데이터의 배관 시스템이라고 생각해 보세요. 집의 배관이 물탱크, 샤워기, 세탁기를 연결하듯이, Data Factory는 90개 이상의 데이터 소스를 연결하고 데이터를 이동시킵니다.
가장 큰 차별점: 코드를 작성할 필요가 없습니다. 드래그 앤 드롭 방식의 시각적 인터페이스를 사용합니다.
활용 예시: 온프레미스 SQL 데이터베이스에서 Azure로 데이터 복사 Amazon S3의 파일을 Azure Blob Storage로 이동 매일 밤 자동으로 파이프라인 실행 예약
Data Factory는 데이터 이동과 오케스트레이션에 특화된 독립 서비스입니다. Synapse에도 유사한 파이프라인이 내장되어 있지만, Synapse의 전체 기능이 필요하지 않을 때는 Data Factory를 단독으로 사용합니다.
Microsoft Fabric — 차세대 통합 분석 플랫폼
Microsoft Fabric은 분석에 대한 Microsoft의 최신 비전입니다. 수집, 변환, 분석, 데이터 과학, 시각화를 하나로 통합하는 SaaS(Software as a Service) 플랫폼입니다.
Synapse가 모든 장비를 갖춘 주방이라면, Fabric은 주방, 레스토랑, 배달 서비스까지 하나의 기업으로 통합한 것과 같습니다.
OneLake — 모든 데이터를 위한 단일 레이크
Fabric의 가장 중요한 개념 중 하나가 OneLake입니다. 여러 스토리지 계정과 데이터 레이크에 데이터가 흩어져 있는 대신, OneLake는 조직의 모든 데이터를 위한 단일 중앙 저장소입니다.
비유하자면, 회사의 각 부서가 각자 서류 캐비닛을 갖고 있는 대신, 모든 부서가 문서를 보관하고 접근하는 하나의 중앙 문서 보관소를 두는 것과 같습니다.
Lakehouse — 두 세계의 장점을 결합
오랫동안 기업들은 두 가지 극단 사이에서 선택해야 했습니다:
데이터 레이크는 유연성을 제공합니다 — 어떤 유형의 데이터(정형, 반정형, 비정형)든 저렴하게 저장할 수 있지만, SQL로 조회하기 어렵습니다.
데이터 웨어하우스는 SQL 쿼리를 위한 구조와 성능을 제공하지만, 비용이 비싸고 정형 데이터만 다룰 수 있습니다.
Lakehouse는 두 세계의 장점을 결합합니다: 데이터 레이크의 유연성과 저비용에 데이터 웨어하우스의 구조화된 쿼리 기능을 더한 것입니다.
| 특성 | Data Lake | Data Warehouse | Lakehouse | |------|-----------|----------------|-----------| | 데이터 유형 | 모든 유형 | 정형 데이터만 | 모든 유형 | | 스토리지 비용 | 낮음 | 높음 | 낮음 | | SQL 쿼리 | 제한적 | 우수 | 양호 | | 머신 러닝 | 우수 | 제한적 | 우수 |
시험 핵심 포인트 요약
"통합 분석 플랫폼 (SQL + Spark + 파이프라인)" → Azure Synapse Analytics "고정 리소스가 할당된 프로비저닝 데이터 웨어하우스" → Synapse Dedicated SQL Pool "쿼리 단위 과금, 프로비저닝 불필요" → Synapse Serverless SQL Pool "빅 데이터 처리 및 머신 러닝 (Spark 기반)" → Synapse Apache Spark Pool "Spark 기반 협업 노트북" → Azure Databricks "데이터 레이크에 ACID + Time Travel 지원" → Delta Lake (Databricks) "코드 없는 데이터 파이프라인, 90+ 커넥터" → Azure Data Factory "OneLake가 포함된 통합 SaaS 플랫폼" → Microsoft Fabric "데이터 레이크의 유연성 + 웨어하우스의 구조" → Lakehouse "목적지에서 변환, 대용량에 적합" → ELT Synapse = 통합 분석 | Data Factory = 파이프라인 전용 | Databricks = Spark 및 ML