SAA-C03 시험에서 데이터 파이프라인 문제는 전체 출제 비중의 약 16%를 차지합니다. "실시간으로 처리할지, 모아서 나중에 처리할지"와 "어떤 서비스 조합이 최적인지"를 이해하면 이 영역을 자신 있게 풀 수 있습니다.
실시간 스트리밍이란 무엇인가요?
공장 컨베이어 벨트를 상상해 봅시다. 제품이 계속 흘러오고, 작업자는 멈추지 않고 각 제품을 처리합니다. 이것이 스트리밍 처리입니다. 반면 하루치 제품을 창고에 모아뒀다가 밤에 한꺼번에 처리하는 것이 배치 처리입니다.
시험에서 "실시간", "즉시", "지속적 데이터 흐름"이 나오면 스트리밍을, "야간 처리", "대량 데이터 변환", "주기적 실행"이 나오면 배치를 생각하세요.
Amazon Kinesis — 실시간 스트리밍의 핵심
Kinesis는 실시간으로 대량의 데이터를 수집하고 처리하는 플랫폼입니다. 세 가지 서비스로 나뉩니다.
Kinesis Data Streams
데이터를 실시간으로 수집하고, 여러 소비자(Consumer)가 각자 원하는 방식으로 처리할 수 있게 합니다. 컨베이어 벨트에서 여러 팀이 각자 필요한 제품을 집어가는 것과 같습니다.
수집된 데이터는 기본 24시간(최대 365일)까지 보관 샤드(Shard) 단위로 용량 관리: 샤드 하나당 초당 1MB 입력, 2MB 출력 Lambda, Kinesis Data Analytics, EC2 애플리케이션 등 여러 소비자가 동시에 읽기 가능 커스텀 처리 로직을 직접 구현해야 함
언제 고르나요? "실시간 수집 + 커스텀 처리", "여러 소비자가 동일 스트림을 읽음", "데이터 재처리 필요"가 나오면 Kinesis Data Streams입니다.
Kinesis Data Firehose
실시간 데이터를 받아서 S3, Redshift, OpenSearch, Splunk 등의 목적지에 자동으로 전달합니다. 완전 관리형 서버리스 서비스이므로 샤드 관리가 필요 없습니다.
컨베이어 벨트의 끝에 자동 분류기가 있어서 제품을 각 창고로 알아서 보내는 것과 같습니다.
버퍼링 후 목적지에 전달 (60초 또는 1~128MB 단위) Lambda를 연결하여 전달 전 데이터 변환 가능 별도의 소비자 코드 없이 바로 저장 가능
언제 고르나요? "실시간 데이터를 S3/Redshift에 자동 저장", "서버리스 스트리밍", "커스텀 코드 없이 자동 전달"이 나오면 Kinesis Data Firehose입니다.
Kinesis Data Analytics
스트리밍 데이터에 SQL 또는 Apache Flink를 사용하여 실시간 분석을 수행합니다. 컨베이어 벨트를 흘러가는 데이터를 보면서 즉석에서 집계·필터·이상 탐지를 하는 것과 같습니다.
초당 단위 집계, 이동 평균, 이상 탐지 등에 활용 결과를 다시 Kinesis Data Streams나 Firehose로 출력 가능
배치 처리와 ETL
AWS Glue — 서버리스 ETL
ETL은 Extract(추출), Transform(변환), Load(적재)의 약자입니다. Glue는 이 과정을 서버 관리 없이 자동화합니다.
Glue 크롤러: S3, RDS 등에 있는 데이터를 자동으로 스캔하여 스키마를 파악 Glue Data Catalog: 발견된 스키마 정보를 메타데이터로 저장 (Athena, EMR이 참조) Glue ETL 작업: Python 또는 Scala로 데이터 변환 스크립트 실행 Glue Studio: 코드 없이 ETL 파이프라인을 시각적으로 구성
언제 고르나요? "서버리스 ETL", "자동 스키마 발견", "데이터 카탈로그", "S3 데이터 변환 자동화"가 나오면 AWS Glue입니다.
Amazon EMR — 대규모 Hadoop/Spark 클러스터
EMR은 Hadoop, Spark, Hive, Presto 같은 빅데이터 프레임워크를 EC2 클러스터 위에서 실행합니다. 대규모 데이터 변환, 기계학습 전처리, 복잡한 분석에 씁니다.
Glue vs EMR: Glue는 서버리스(관리 불필요), EMR은 클러스터를 직접 구성하여 더 유연한 커스터마이징 가능.
언제 고르나요? "Hadoop/Spark", "대규모 데이터 변환", "클러스터 직접 관리", "커스텀 빅데이터 프레임워크"가 나오면 EMR입니다.
AWS DataSync
온프레미스 파일 시스템에서 S3, EFS, FSx로 대량 데이터를 빠르게 전송합니다. 단순 데이터 이전(마이그레이션)이나 정기적 동기화에 씁니다.
언제 고르나요? "온프레미스 → S3 대량 데이터 전송", "정기적 파일 동기화"가 나오면 DataSync입니다.
분석 서비스
Amazon Athena — S3 위의 SQL
S3에 저장된 데이터를 서버 없이 SQL로 직접 분석합니다. 별도의 데이터베이스에 데이터를 옮기지 않아도 됩니다. Glue 데이터 카탈로그와 연동하면 테이블 정의를 자동으로 가져올 수 있습니다.
완전 서버리스: 쿼리한 만큼만 비용 발생 CSV, JSON, Parquet, ORC 등 다양한 포맷 지원 컬럼 형식(Parquet)으로 저장하면 쿼리 속도·비용 최적화
언제 고르나요? "S3 데이터를 SQL로 분석", "서버리스 쿼리", "별도 DB 없이 S3 직접 조회"가 나오면 Athena입니다.
Amazon Redshift — 데이터 웨어하우스
페타바이트 규모의 정형 데이터를 고성능으로 분석하는 데이터 웨어하우스입니다. OLAP(분석용 대규모 집계 쿼리)에 최적화되어 있습니다.
Redshift Spectrum: Redshift 클러스터에서 S3 데이터를 직접 조회 (데이터 이전 불필요) 자동 스냅샷, 자동 스케일링 OLTP(트랜잭션) = RDS/Aurora/DynamoDB. OLAP(분석) = Redshift.
언제 고르나요? "대규모 데이터 웨어하우스", "OLAP", "대규모 집계·분석 쿼리"가 나오면 Redshift입니다.
Amazon QuickSight — BI 시각화
Athena, Redshift, S3 등의 데이터를 연결하여 대시보드와 차트를 만드는 서버리스 BI 도구입니다.
언제 고르나요? "BI 대시보드", "데이터 시각화"가 나오면 QuickSight입니다.
AWS Lake Formation — 데이터 레이크 관리
S3를 중심으로 한 데이터 레이크를 쉽게 구축하고, 세밀한 데이터 접근 권한을 관리합니다. Glue, Athena, Redshift와 통합됩니다.
언제 고르나요? "데이터 레이크 구축", "중앙 데이터 접근 제어", "열 수준 보안"이 나오면 Lake Formation입니다.