스트리밍과 배치 데이터 수집

Kinesis Data Streams/Firehose, MSK, DMS, AppFlow 등 데이터 수집 서비스를 비교합니다.

데이터 수집(Data Ingestion)은 데이터 엔지니어링 파이프라인의 첫 번째 단계입니다. 공장이 원자재를 받아야 제품을 만들 수 있듯이, 데이터 시스템도 먼저 데이터를 수집해야 분석이 가능합니다. AWS DEA-C01 시험에서는 "어떤 상황에서 어떤 수집 서비스를 선택하는가"를 집중적으로 묻습니다. 이 글에서는 스트리밍과 배치라는 두 가지 핵심 개념부터 시작해, 각 서비스의 특징과 사용 시나리오를 초보자도 이해할 수 있도록 설명합니다.

 

스트리밍 vs 배치 — 물 공급에 비유해보면

데이터를 수집하는 방식은 크게 두 가지로 나뉩니다.

스트리밍(Streaming)은 수도관처럼 데이터가 실시간으로 끊임없이 흘러오는 방식입니다. 사용자가 앱을 클릭할 때마다, 센서가 온도를 측정할 때마다, 그 순간순간의 데이터가 즉시 전송됩니다. 지연 시간이 밀리초~초 단위이며, "지금 무슨 일이 일어나고 있는가"를 알고 싶을 때 사용합니다.

배치(Batch)는 물탱크에 물을 모아 한꺼번에 공급하는 방식입니다. 하루치 거래 기록을 자정에 한 번 처리하거나, 매주 월요일 아침에 지난 주 판매 데이터를 분석하는 식입니다. 실시간성은 없지만 처리 효율이 높고 구현이 단순합니다.

| 구분 | 스트리밍 | 배치 | |------|---------|------| | 데이터 도착 | 실시간 (연속적) | 주기적 (한꺼번에) | | 지연 시간 | 밀리초~초 | 분~시간~일 | | 사용 예시 | 실시간 사기 감지, 주식 가격 모니터링 | 월간 매출 보고서, 야간 ETL 작업 | | AWS 서비스 | Kinesis Data Streams, MSK | DMS, AppFlow, Transfer Family |

!스트리밍 vs 배치 데이터 수집

Kinesis Data Streams — 실시간 데이터의 고속도로

Kinesis Data Streams는 대용량 실시간 데이터를 수집하고 처리하기 위한 서비스입니다. 고속도로의 차선(샤드, Shard)을 상상해보세요. 차선이 많을수록 더 많은 차(데이터)가 동시에 달릴 수 있습니다.

샤드(Shard)의 개념을 이해하는 것이 핵심입니다. 각 샤드는 초당 1MB 쓰기 / 2MB 읽기 처리량을 제공합니다. 데이터가 많아지면 샤드 수를 늘려(샤드 분할, Shard Splitting) 처리량을 확장합니다.

파티션 키(Partition Key)는 어떤 샤드에 데이터를 보낼지 결정합니다. 같은 파티션 키를 가진 데이터는 항상 같은 샤드로 들어갑니다. 예를 들어 고객 ID를 파티션 키로 쓰면, 동일 고객의 이벤트는 순서대로 같은 샤드에 저장됩니다.

주요 특징:

보존(Retention): 기본 24시간, 최대 365일까지 데이터를 샤드에 보존합니다. 처리 중 오류가 발생해도 데이터가 남아 있습니다. 재처리(Replayability): 같은 데이터를 여러 번 읽을 수 있습니다. 처리 로직을 수정한 뒤 처음부터 다시 분석하거나, 여러 시스템이 동일 스트림을 각자 독립적으로 읽을 수 있습니다. 소비자 연결: AWS Lambda, Kinesis Data Firehose, KCL(Kinesis Client Library) 등 다양한 소비자가 동시에 연결 가능합니다. Enhanced Fan-out: 일반 모드에서는 샤드당 2MB/s를 모든 소비자가 공유하지만, Enhanced Fan-out을 사용하면 각 소비자가 2MB/s를 독점적으로 사용합니다. 여러 소비자가 동시에 높은 처리량을 필요로 할 때 사용합니다.

Kinesis Data Streams는 직접 관리가 필요한 서비스입니다. 샤드 수를 직접 설정하고, 소비자 애플리케이션도 직접 개발해야 합니다. 그 대신 완전한 커스터마이징이 가능하고, 재처리도 자유롭게 할 수 있습니다.

 

Kinesis Data Firehose — 데이터를 목적지까지 자동 배달

Kinesis Data Firehose는 "데이터를 받아서 정해진 목적지에 자동으로 배달해주는 택배 서비스"입니다. 택배기사(Firehose)가 물건(데이터)을 받아서 주소지(S3, Redshift, OpenSearch 등)로 자동으로 가져다줍니다.

서버리스(Serverless) 서비스이므로 인프라를 직접 관리할 필요가 없습니다. 샤드도, 서버도 없습니다. 그냥 데이터를 보내면 Firehose가 알아서 처리합니다.

주요 특징:

자동 전달 목적지: Amazon S3, Amazon Redshift, Amazon OpenSearch Service, HTTP 엔드포인트 등으로 자동 전달됩니다. 버퍼링(Buffering): 데이터를 즉시 하나씩 전달하지 않고, 일정 크기(예: 5MB) 또는 일정 시간(예: 60초)이 지나면 모아서 배치로 전달합니다. 이렇게 하면 목적지(예: S3)에 파일이 너무 작게 많이 생기는 문제를 방지합니다. Lambda 변환: 데이터를 목적지에 보내기 전에 Lambda 함수를 호출해 변환할 수 있습니다. 예를 들어 JSON 데이터를 Parquet 형식으로 변환하거나, 민감 정보를 마스킹할 수 있습니다. 커스텀 소비자 불가: Kinesis Data Streams와 달리 목적지가 정해져 있습니다. 자신만의 소비자 애플리케이션을 붙일 수 없습니다. 재처리 불가: 이미 전달된 데이터를 다시 읽을 수 없습니다.

Kinesis Data Streams vs Kinesis Data Firehose:

| 항목 | Data Streams | Firehose | |------|-------------|---------| | 관리 | 직접 샤드 관리 | 완전 서버리스 | | 소비자 | 커스텀 소비자 가능 | 정해진 목적지만 | | 재처리 | 가능 | 불가 | | 지연 시간 | 밀리초 | 수십 초~수 분 | | 사용 상황 | 복잡한 실시간 처리 | S3/Redshift 자동 적재 |

 

Amazon MSK — 카프카를 AWS에서 관리형으로

Apache Kafka는 LinkedIn이 개발한 오픈소스 스트리밍 플랫폼으로, 대규모 실시간 데이터 스트리밍에 널리 사용됩니다. Amazon MSK(Managed Streaming for Apache Kafka)는 Kafka 클러스터를 AWS가 대신 관리해주는 서비스입니다.

"내가 직접 Kafka 서버를 설치하고 운영하는 것"과 "AWS가 Kafka를 대신 관리해주는 것(MSK)"의 차이를 생각해보세요. MSK를 사용하면 브로커 업그레이드, 패치, 장애 복구를 AWS가 처리합니다.

MSK와 Kinesis Data Streams의 비교:

| 항목 | Amazon MSK | Kinesis Data Streams | |------|-----------|---------------------| | 기반 기술 | Apache Kafka | AWS 독자 기술 | | 에코시스템 | Kafka 생태계 완전 호환 | AWS 네이티브 | | 마이그레이션 | 기존 Kafka 코드 그대로 사용 | 코드 재작성 필요 | | 관리 복잡도 | 상대적으로 높음 | 낮음 | | 선택 기준 | Kafka 에코시스템이 필요할 때 | AWS 중심 신규 프로젝트 |

시험 포인트: 문제에 "기존 Kafka 워크로드를 AWS로 이전" 또는 "Kafka 에코시스템"이 나오면 MSK, "AWS 네이티브 스트리밍"이 나오면 Kinesis Data Streams를 선택합니다.

 

배치 수집 서비스 — 모아서 한 번에 처리하기

실시간이 아닌 주기적·대량 수집에는 다음 서비스들을 사용합니다.

AWS DMS (Database Migration Service)

DMS는 데이터베이스를 이전하거나 데이터를 복제하는 서비스입니다. 이사 전문 업체처럼, DMS는 기존 집(소스 DB)의 가구(데이터)를 새 집(대상 DB)으로 옮겨줍니다.

동종 마이그레이션: MySQL에서 MySQL로, Oracle에서 Oracle로 이종 마이그레이션: Oracle에서 Aurora PostgreSQL로, SQL Server에서 MySQL로 CDC(Change Data Capture): 소스 DB의 변경 사항(INSERT/UPDATE/DELETE)을 실시간으로 캡처해 대상에 반영합니다. 데이터베이스의 "변경 일기"를 계속 따라가는 것과 같습니다. 전체 로드 + CDC 조합: 처음에 전체 데이터를 복사하고, 이후에는 변경 사항만 지속적으로 동기화합니다.

AWS AppFlow

AppFlow는 Salesforce, SAP, Google Analytics, Slack 같은 SaaS(클라우드 기반 소프트웨어) 서비스의 데이터를 AWS로 가져오는 서비스입니다. 각 SaaS 서비스의 API를 직접 연동하는 코드를 작성하는 대신, AppFlow가 클릭 몇 번으로 연동을 설정해줍니다.

목적지: S3, Redshift, Salesforce, Snowflake 등 일정 예약 또는 이벤트 기반 실행 전송 중 데이터 필터링 및 변환 가능 코드 없이 SaaS 데이터 수집

AWS Transfer Family

Transfer Family는 SFTP, FTP, FTPS, AS2 프로토콜로 S3 또는 EFS에 파일을 업로드·다운로드할 수 있게 해주는 서비스입니다. 거래처가 CSV 파일을 매일 SFTP로 보내주는데, 그것을 자동으로 S3에 저장하고 싶을 때 사용합니다.

S3 Event Notifications

S3에 파일이 업로드되거나 삭제될 때 자동으로 다른 서비스를 트리거하는 기능입니다. 예를 들어 파트너사가 S3 버킷에 CSV를 업로드하면, 즉시 Lambda 함수가 실행되어 데이터를 처리하는 파이프라인을 구성할 수 있습니다. SQS, SNS, Lambda, EventBridge로 알림을 보낼 수 있습니다.

 

시험 핵심 정리

| 키워드 | 선택 서비스 | |--------|-----------| | 실시간 스트리밍, 커스텀 처리, 재처리 가능 | Kinesis Data Streams | | 실시간 데이터를 S3/Redshift에 자동 적재, 서버리스 | Kinesis Data Firehose | | Apache Kafka 관리형, 기존 Kafka 마이그레이션 | Amazon MSK | | 데이터베이스 마이그레이션, CDC | AWS DMS | | SaaS 앱(Salesforce 등)에서 데이터 수집 | AWS AppFlow | | SFTP/FTP로 S3에 파일 전송 | AWS Transfer Family | | S3 파일 업로드 시 자동 처리 트리거 | S3 Event Notifications + Lambda |

Data Streams vs Firehose 결정 기준: 커스텀 소비자가 필요하거나 재처리가 필요하면 Data Streams, 단순히 S3/Redshift에 자동으로 모으기만 하면 Firehose를 선택합니다.

블로그 목록으로 돌아가기