DR/복원력 아키텍처와 비용 가시성

DR 전략 4가지(Backup-Restore~Multi-Site), RTO/RPO 트레이드오프, Cost Explorer, Compute Optimizer를 정리합니다.

재해 복구(DR)와 비용 가시성은 SAP-C02 D1의 마지막 두 태스크입니다. 문제 수는 적지만, 다른 도메인(D2, D3)에서도 DR과 비용 개념이 반복적으로 등장하기 때문에 반드시 완벽하게 이해해야 합니다.

DR 설계의 핵심은 "비즈니스가 감당할 수 있는 다운타임과 데이터 손실 범위"를 먼저 정의하고, 그에 맞는 전략을 선택하는 것입니다. 비용 가시성은 "어디에 얼마를 쓰고 있는지 파악하고, 최적화 기회를 찾는 것"입니다.

 

RTO와 RPO 이해하기

RTO(Recovery Time Objective)는 "장애 발생 후 서비스가 복구될 때까지 허용되는 최대 시간"입니다. RPO(Recovery Point Objective)는 "장애 시 허용되는 최대 데이터 손실량(시간 단위)"입니다.

예를 들어 RTO 1시간, RPO 15분이라면, 장애 발생 후 1시간 안에 서비스가 복구되어야 하고, 최대 15분 전까지의 데이터만 손실될 수 있습니다.

RTO와 RPO가 짧을수록 더 많은 인프라와 비용이 필요합니다. 시험에서는 항상 이 트레이드오프를 묻습니다.

 

DR 전략 4가지

AWS는 4가지 DR 전략을 제시하며, 비용과 복구 속도가 정반대 관계입니다.

| 전략 | RTO | RPO | 비용 | 설명 | |------|-----|-----|------|------| | Backup and Restore | 수 시간 | 수 시간 | 최저 | 백업에서 복원. 인프라를 새로 프로비저닝 | | Pilot Light | 수십 분 | 수 분 | 낮음 | 핵심 인프라(DB)만 상시 실행. 나머지는 장애 시 프로비저닝 | | Warm Standby | 수 분 | 수 초~분 | 중간 | 축소된 전체 환경 상시 실행. 장애 시 스케일 업 | | Multi-Site Active-Active | 거의 0 | 거의 0 | 최고 | 두 리전에서 동시에 트래픽 처리. 즉시 전환 |

Pilot Light에서는 데이터베이스 복제본(RDS Cross-Region Read Replica 등)만 DR 리전에 유지하고, 웹/앱 서버는 장애 발생 시 AMI에서 새로 시작합니다. Warm Standby는 모든 계층이 축소된 상태로 실행 중이므로 스케일 업만 하면 됩니다.

Elastic Disaster Recovery(DRS)는 리호스트 방식의 DR 자동화 서비스입니다. 온프레미스 또는 다른 클라우드의 서버를 AWS로 지속적으로 복제하고, 장애 시 몇 분 안에 EC2 인스턴스로 복구합니다.

 

비용 가시성 도구

조직 차원에서 비용을 파악하고 최적화하는 것은 Solutions Architect의 중요한 역할입니다.

Cost Explorer는 비용과 사용량을 시각화하는 도구입니다. 서비스별, 계정별, 태그별로 비용을 분석하고, 예측 기능으로 향후 비용을 추정합니다. 비용 할당 태그를 활성화하면 비즈니스 단위별로 비용을 매핑할 수 있습니다.

Trusted Advisor는 비용 최적화, 성능, 보안, 내결함성, 서비스 한도 5가지 카테고리에서 권장 사항을 제공합니다. 미사용 리소스(유휴 EC2, 연결되지 않은 EBS 볼륨 등)를 식별하는 데 특히 유용합니다.

Compute Optimizer는 EC2 인스턴스, Auto Scaling 그룹, Lambda 함수, EBS 볼륨의 사용 패턴을 분석하여 Right-sizing 권장 사항을 제공합니다. CloudWatch 지표 데이터를 기반으로 과다/과소 프로비저닝된 리소스를 식별합니다.

 

구매 옵션 비교

| 옵션 | 할인율 | 약정 | 적합한 워크로드 | |------|--------|------|----------------| | On-Demand | 없음 | 없음 | 예측 불가능한 단기 워크로드 | | Reserved Instance | 최대 72% | 1년/3년 | 안정적이고 예측 가능한 워크로드 | | Savings Plans (Compute) | 최대 66% | 1년/3년 | 리전/패밀리 변경 가능. 유연성 필요 시 | | Savings Plans (EC2 Instance) | 최대 72% | 1년/3년 | 특정 리전+패밀리. 최대 할인 | | Spot Instance | 최대 90% | 없음 | 중단 허용 가능한 배치/비상태 워크로드 |

Savings Plans는 Reserved Instance보다 유연합니다. Compute Savings Plans는 EC2, Fargate, Lambda 모두에 적용되며 리전과 인스턴스 패밀리를 변경해도 할인이 유지됩니다. EC2 Instance Savings Plans는 특정 리전과 인스턴스 패밀리를 고정하는 대신 더 높은 할인율을 제공합니다.

S3 Storage Lens는 S3 사용 패턴을 조직 전체에서 분석합니다. 버킷별 스토리지 사용량, 요청 패턴, 비용을 시각화하고 이상 탐지 기능도 제공합니다.

!EC2 구매 옵션 비교

실무 시나리오

시나리오 1: 금융 서비스 기업이 RPO 5분, RTO 30분을 요구합니다. Backup-Restore는 RTO가 수 시간이므로 부적합합니다. Pilot Light(RDS Cross-Region Read Replica + AMI 기반 복구)가 비용 효율적인 선택입니다.

시나리오 2: 전자상거래 기업이 제로 다운타임을 요구합니다. Multi-Site Active-Active(Route 53 Latency-based Routing + 두 리전에 완전한 스택)가 필요합니다. 비용이 가장 높지만 RTO/RPO가 거의 0입니다.

시나리오 3: 스타트업이 월 AWS 비용을 30% 줄여야 합니다. Compute Optimizer로 과다 프로비저닝된 EC2를 식별하고, 안정적 워크로드에 Compute Savings Plans를 적용하고, 배치 작업에 Spot Instance를 사용합니다.

 

시험 핵심 정리

"최저 비용 DR" -- Backup and Restore

"핵심 DB만 상시 유지, 나머지 장애 시 복구" -- Pilot Light

"축소된 전체 환경 상시 실행" -- Warm Standby

"제로 다운타임, 즉시 전환" -- Multi-Site Active-Active

"RTO가 짧을수록" -- 비용이 높아짐

"온프레미스 서버 AWS 복제 DR" -- Elastic Disaster Recovery (DRS)

"과다 프로비저닝 EC2 식별" -- Compute Optimizer

"비용을 비즈니스 단위별로 매핑" -- 비용 할당 태그 + Cost Explorer

"EC2/Fargate/Lambda 모두 할인, 리전 유연" -- Compute Savings Plans

"S3 사용 패턴 조직 전체 분석" -- S3 Storage Lens

"미사용 리소스 식별" -- Trusted Advisor

블로그 목록으로 돌아가기