Redshift 완벽 정리

Amazon Redshift의 컬럼형 스토리지·MPP·Data API 개념을 시험 관점으로 정리했습니다. JDBC vs Data API 비교와 실무 활용 포인트까지 한눈에 확인하세요.

Amazon Redshift 완전 정리 (DEA-C01 시험 핵심)

들어가며

도메인 2: 데이터 스토어 관리(26%)에서 빠질 수 없는 서비스가 바로 Amazon Redshift입니다. 페타바이트 규모의 완전 관리형 데이터 웨어하우스로, 시험에서는 Redshift의 내부 아키텍처, 데이터 로딩 패턴, 그리고 Data API 활용이 자주 출제됩니다.

---

Redshift 핵심 아키텍처 — 왜 빠른가?

Redshift가 대용량 분석 쿼리에서 빠른 이유는 두 가지 핵심 설계 원칙에 있습니다.

컬럼형 스토리지 (Columnar Storage)

전통적인 행 기반 DB는 전체 행을 읽지만, Redshift는 필요한 컬럼만 읽음 분석 쿼리(집계·필터)에서 I/O를 획기적으로 줄임 동일 컬럼 데이터는 압축률이 높아 스토리지 비용 절감

MPP (Massively Parallel Processing)

여러 노드에 데이터와 쿼리 부하를 분산 처리 노드 수를 늘릴수록 처리 속도 선형 향상

시험 팁: "대용량 분석 쿼리에 적합한 AWS 서비스는?" 라는 질문에는 Amazon Redshift(컬럼형 + MPP)가 정답입니다.

---

Redshift 핵심 스펙 요약

| 항목 | 내용 | |------|------| | 스토리지 모델 | 컬럼형 스토리지 (Columnar) | | 처리 방식 | MPP (대규모 병렬 처리) | | 확장성 | GB에서 페타바이트까지, 무중단 확장 | | 쿼리 지연 | 낮은 지연 (Near Real-time Analytics) | | 과금 방식 | 사용한 만큼 지불 (Pay-as-you-go) | | 주요 연동 서비스 | Amazon S3, AWS Glue, Amazon QuickSight, SNS |

---

AWS 생태계 연동

Redshift는 단독으로 쓰이지 않고 AWS 서비스들과 강하게 연동됩니다. 시험에서 아키텍처 설계 문제가 나올 때 다음 흐름을 기억해 두면 도움이 됩니다.

시험 팁: S3 데이터를 Redshift로 로드할 때는 COPY 명령어를 사용합니다. INSERT보다 훨씬 빠르기 때문에 대량 로드의 표준 방법으로 출제됩니다.

---

Amazon Redshift Data API — 서버리스 환경에서의 활용

Redshift Data API는 JDBC/ODBC 드라이버 없이 HTTPS 요청만으로 Redshift에 SQL을 실행할 수 있는 완전 관리형 인터페이스입니다. 서버리스 아키텍처와의 통합이 주요 특징입니다.

주요 특징

AWS Lambda처럼 연결 상태를 유지하기 어려운 서버리스 환경에서도 Redshift 사용 가능 IAM 기반 인증으로 보안 강화 드라이버 설치나 연결 풀 관리가 불필요

Data API 동작 방식

주요 파라미터

| 파라미터 | 설명 | |---------|------| | ClusterIdentifier / WorkgroupName | 대상 클러스터 또는 Serverless 워크그룹 | | Database | 쿼리 실행 대상 데이터베이스 | | DbUser | 데이터베이스 사용자 (IAM 역할 또는 시크릿 관리) | | Sql | 실행할 SQL 문 | | StatementId | 비동기 쿼리 추적 및 결과 조회용 ID |

---

JDBC/ODBC 직접 연결 vs Data API 비교

두 접근 방식의 차이를 이해하면 시험 아키텍처 문제에서 올바른 서비스를 선택할 수 있습니다.

| 비교 항목 | 직접 JDBC/ODBC 연결 | Redshift Data API | |-----------|--------------------|--------------------| | 연결 설정 | 드라이버 설치 필요 | HTTP 요청만으로 가능 | | 연결 상태 | 지속적 TCP 연결 | 상태 없음 (Stateless) | | 주요 활용 | BI 툴, 전통적 앱 | 서버리스, 자동화 스크립트 | | 인증 방식 | DB 인증 필요 | IAM 기반 인증 | | 확장성 | 연결 수 제한 있음 | 제한 없이 확장 |

시험 팁: Lambda에서 Redshift를 조회해야 하는 시나리오에서는 Data API를 사용합니다. JDBC는 Lambda의 비연결형 실행 모델에 적합하지 않습니다.

---

Data API 활용 시나리오

| 시나리오 | 적합 여부 | |---------|----------| | Lambda 함수에서 Redshift 쿼리 실행 | 최적 | | Step Functions로 분석 워크플로 자동화 | 최적 | | EventBridge로 주기적 리포트 스케줄링 | 최적 | | BI 툴(QuickSight, Tableau)에서 직접 연결 | JDBC/ODBC 사용 권장 | | OLTP(트랜잭션 처리) 워크로드 | Redshift 자체가 부적합 |

---

Data API 주의사항

실제 시험에서 함정으로 자주 등장하는 항목들입니다.

지연 시간: HTTP 오버헤드로 인해 직접 연결보다 약간 높음 SQL 크기 제한: 페이로드 크기 제한 준수 필요 OLTP 부적합: 분석·배치·Ad-hoc 쿼리에 최적화된 서비스 대용량 결과: 페이지네이션(Pagination) 처리 필요

---

핵심 키워드 요약

| 키워드 | 연결 개념 | |--------|----------| | 컬럼형 스토리지 | 분석 쿼리 I/O 최소화 | | MPP | 병렬 분산 처리로 빠른 쿼리 | | COPY 명령어 | S3에서 Redshift로 대량 로드 | | Data API | 서버리스/Lambda에서 Redshift 접근 | | IAM 인증 | Data API 보안의 핵심 | | StatementId | 비동기 쿼리 결과 추적 |

---

마무리

Amazon Redshift는 DEA-C01에서 데이터 스토어 관리 도메인의 핵심 서비스입니다. 특히 Data API와 JDBC 비교, 컬럼형 스토리지의 장점, S3와의 연동 패턴은 시험에서 자주 출제되는 주제입니다. 다음 포스팅에서는 데이터 보안 및 거버넌스(18%) 도메인을 다룰 예정입니다.

블로그 목록으로 돌아가기