GenAI 애플리케이션을 운영 환경에서 지속 가능하게 운영하려면 비용, 성능, 품질 세 가지 차원을 동시에 관리해야 합니다. 이번 포스팅에서는 Amazon Bedrock의 비용 최적화 전략부터 CloudWatch 기반 운영 모니터링, 그리고 모델 평가 지표까지 AIP-C01 운영 도메인 핵심을 다룹니다.
Provisioned Throughput vs 온디맨드 — 언제 무엇을 선택하는가
Amazon Bedrock의 요금 모델은 크게 두 가지입니다.
| 구분 | 온디맨드(On-Demand) | Provisioned Throughput | |------|-------------------|----------------------| | 요금 방식 | 처리한 토큰 수만큼 지불 | 시간당 고정 요금 (Model Unit 단위) | | 처리량 보장 | 없음 (트래픽에 따라 변동) | 예약된 처리량 보장 | | 최소 약정 | 없음 | 1개월 또는 6개월 약정 | | 적합한 상황 | 불규칙한 워크로드, 개발/테스트 | 예측 가능한 대규모 트래픽 |
Provisioned Throughput의 단위는 입니다. MU가 높을수록 초당 처리할 수 있는 토큰 수가 증가합니다. 트래픽이 일정하고 예측 가능하면 온디맨드보다 Provisioned Throughput이 비용 효율적입니다. 반대로 피크 타임에만 집중되거나 개발/테스트 단계에서는 온디맨드가 유리합니다.
시험에서 "처리량 안정성이 중요한 프로덕션 워크로드"가 언급되면 Provisioned Throughput을 선택합니다. "비용 예측 가능성"도 Provisioned Throughput의 장점입니다.
토큰 기반 요금 최적화 전략
Bedrock 온디맨드 요금은 입력 토큰과 출력 토큰 수로 결정됩니다. 출력 토큰 단가가 입력 토큰보다 보통 3~5배 높으므로 출력 최적화가 더 중요합니다.
실무 최적화 전략:
: 응답 길이를 적절히 제한합니다. 요약 작업에서 500토큰 이상이 필요 없다면 으로 설정해 불필요한 비용을 방지합니다.
: 시스템 프롬프트를 간결하게 유지합니다. 반복적으로 전달하는 긴 맥락 정보는 요약하거나 구조화해 토큰 수를 줄입니다.
: 동일하거나 유사한 쿼리에 대한 응답을 캐싱합니다. ElastiCache 또는 DynamoDB에 쿼리 해시 → 응답 매핑을 저장하면 반복 요청의 비용을 제거할 수 있습니다. Bedrock Knowledge Base도 내부 응답 캐싱을 지원합니다.
: 실시간 응답이 불필요한 작업(문서 분류, 데이터 레이블링 등)은 Bedrock Batch Inference를 사용합니다. 비동기로 처리되며 온디맨드 대비 비용이 최대 50% 절감됩니다.
모델 크기 최적화 — 양자화와 증류
운영 비용은 모델 크기에 직접 비례합니다. 동일한 작업에서 더 작은 모델로도 충분한 품질을 얻을 수 있다면 비용이 크게 절감됩니다.
: 모델 가중치의 표현 정밀도를 낮춥니다. FP32 → FP16 → INT8 → INT4 순으로 메모리 사용량과 추론 속도가 개선됩니다. 품질 손실은 작업의 정밀도 요구에 따라 다릅니다. Bedrock에서는 모델 제공사가 이미 양자화된 버전을 제공하는 경우가 많습니다.
: 큰 모델(Teacher)이 생성한 출력을 레이블로 사용해 작은 모델(Student)을 훈련합니다. SageMaker에서 Custom Model 훈련 시 이 기법을 적용할 수 있습니다. Student 모델은 Teacher의 70~80% 성능을 1/5~1/10 비용으로 달성하는 경우가 많습니다.
AWS Inferentia와 AWS Trainium
AWS Inferentia는 ML 추론에 최적화된 AWS의 커스텀 칩입니다. GPU 기반 인스턴스 대비 최대 70% 낮은 추론 비용을 제공합니다. SageMaker에서 인스턴스 타입으로 사용합니다.
AWS Trainium은 딥러닝 훈련에 최적화된 칩입니다. 인스턴스 타입으로 대규모 모델 훈련 비용을 절감합니다. Bedrock Fine-tuning보다 커스텀 훈련에 더 많은 제어권을 원할 때 SageMaker + Trainium 조합을 선택합니다.
시험에서 "훈련 비용 절감" → Trainium, "추론 비용 절감" → Inferentia로 구분합니다.
Auto Scaling 전략
SageMaker 엔드포인트는 Application Auto Scaling으로 인스턴스 수를 자동 조정합니다. 주요 스케일링 정책:
: 메트릭 기반으로 인스턴스당 초당 요청 수를 목표치에 유지.
: 메트릭 임계값에 따라 미리 정의된 단계별로 조정.
: 예측 가능한 트래픽 패턴(예: 평일 9~18시 피크)에 대해 시간 기반 스케일링.
스케일 다운 안정화 시간(cooldown)을 적절히 설정해 과도한 스케일링을 방지합니다. 콜드 스타트 지연이 허용되지 않는 경우 최소 인스턴스 수를 1 이상으로 유지합니다.
Amazon CloudWatch 메트릭과 로그
Bedrock은 CloudWatch에 자동으로 메트릭을 전송합니다. 주요 모니터링 대상:
| 메트릭 | 설명 | 알람 기준 | |--------|------|-----------| | | 요청부터 응답까지 전체 시간 | P99 > 10초 | | | 스로틀링된 요청 수 | > 0 지속 시 Provisioned 전환 검토 | | | 4xx 오류 (잘못된 요청) | 급증 시 입력 검증 점검 | | | 5xx 오류 (서버 오류) | > 0 즉시 알람 | | / | 토큰 사용량 추적 | 예산 대비 비율 모니터링 |
Knowledge Base 사용 시 추가 메트릭:
: RAG 전체 파이프라인 지연 : 검색된 문서 수
AWS X-Ray 분산 추적
GenAI 애플리케이션은 여러 서비스(Lambda → Bedrock → Knowledge Base → OpenSearch)를 거치므로 각 단계의 지연을 추적하기 어렵습니다. AWS X-Ray는 요청을 추적해 병목 지점을 시각화합니다.
Lambda에서 X-Ray 추적을 활성화하면 Bedrock 호출을 포함한 전체 요청 흐름이 X-Ray 서비스 맵에 나타납니다. P95/P99 지연이 높은 세그먼트를 식별해 최적화 우선순위를 결정합니다.
SageMaker Model Monitor — 드리프트 감지
프로덕션 모델은 시간이 지남에 따라 성능이 저하됩니다. 입력 데이터 분포가 훈련 데이터와 달라지는 , 모델 출력 품질이 저하되는 가 발생할 수 있습니다.
SageMaker Model Monitor는 4가지 모니터링 유형을 제공합니다:
| 유형 | 탐지 대상 | |------|----------| | Data Quality Monitor | 입력 데이터 통계 드리프트 (평균, 분산, 결측값) | | Model Quality Monitor | 예측 정확도 드리프트 (레이블 데이터 필요) | | Bias Drift Monitor | Clarify 편향 지표 드리프트 | | Feature Attribution Drift | SHAP 특성 중요도 변화 |
기준선(Baseline)은 훈련 데이터의 통계적 특성을 저장한 것입니다. Monitor가 주기적으로 실제 입력 분포를 기준선과 비교해 임계값 초과 시 CloudWatch 알람을 발생시킵니다.
Bedrock Model Evaluation Job
Bedrock Model Evaluation은 모델 성능을 자동으로 평가하는 관리형 기능입니다. 평가 작업 유형:
: 내장 알고리즘으로 요약, 질의응답, 분류 품질을 측정. : Amazon A2I 통합으로 인간 평가자가 응답 품질을 직접 평가.
평가 데이터셋은 S3에 JSONL 형식으로 저장하고 작업 생성 시 지정합니다. 평가 결과도 S3에 저장되어 Athena나 QuickSight로 분석할 수 있습니다.
자동 평가 지표 — ROUGE, BLEU, BERTScore
ROUGE (Recall-Oriented Understudy for Gisting Evaluation)
ROUGE는 요약 품질 평가에 주로 사용됩니다. 모델 출력이 참조 답안과 얼마나 겹치는지 측정합니다.
: 단어(unigram) 단위 겹침 : 2-gram 단위 겹침 (연속된 두 단어) : 최장 공통 부분 수열(LCS) 기반 겹침
값이 높을수록 참조 답안과 유사한 내용을 포함했다는 의미입니다. 하지만 의미적 동의어를 같은 단어로 인식하지 못하는 한계가 있습니다.
BLEU (Bilingual Evaluation Understudy)
BLEU는 기계 번역 품질 평가에 주로 사용됩니다. n-gram 정밀도(Precision)를 기반으로 합니다. 참조 답안 대비 출력의 정밀도를 1-gram부터 4-gram까지 측정해 기하 평균을 냅니다.