AIP-C01: FM 모델 선택과 솔루션 설계

AIP-C01 시험 핵심 — Amazon Bedrock 모델 카탈로그 비교, 추론 파라미터 튜닝, Provisioned Throughput과 온디맨드 트레이드오프를 실무 관점에서 정리합니다.

AIP-C01 시험에서 FM(Foundation Model) 선택은 단순히 모델 이름을 외우는 게 아닙니다. 실제 GenAI 솔루션을 설계할 때 비즈니스 요구사항을 모델 특성에 매핑하는 능력을 검증합니다. 이 글에서는 Amazon Bedrock의 모델 카탈로그, 추론 파라미터 튜닝, Provisioned Throughput 선택 기준을 실무 관점에서 깊이 살펴봅니다.

 

GenAI 솔루션 요구사항 분석 방법

모델을 선택하기 전에 요구사항을 세 가지 축으로 분해합니다.

입출력 모달리티

| 입력 타입 | 출력 타입 | 예시 use case | |-----------|-----------|--------------| | 텍스트 | 텍스트 | 챗봇, 요약, 번역, 코드 생성 | | 이미지 + 텍스트 | 텍스트 | 문서 OCR 분석, 시각적 QA | | 텍스트 | 이미지 | 광고 소재 생성, 제품 목업 | | 텍스트 | 임베딩 벡터 | RAG 인덱싱, 시맨틱 검색 |

텍스트 전용 use case에 멀티모달 모델을 쓰면 비용만 낭비합니다. 반대로 이미지를 분석해야 하는데 텍스트 전용 모델을 쓰면 기능 자체가 불가능합니다.

성능 트리플 트레이드오프

모델 선택은 항상 세 가지 요소가 맞물립니다.

실시간 챗봇이라면 지연이 가장 중요합니다. 야간 배치 보고서 생성이라면 품질과 비용이 우선입니다. 예산이 빡빡한 스타트업 프로젝트라면 비용을 최우선에 놓습니다. 이 트레이드오프를 명확히 정의하지 않으면 모델 선택이 흔들립니다.

!비용-지연-품질 트레이드오프

컨텍스트 윈도우 크기

장문 법률 계약서 분석이나 대용량 코드베이스 검토처럼 한 번에 처리해야 할 텍스트가 많다면 컨텍스트 윈도우 크기가 결정적입니다. Claude 3.5 Sonnet은 200K 토큰을 지원하므로 300페이지 분량 문서를 통째로 넣어 분석할 수 있습니다.

 

Amazon Bedrock 모델 카탈로그

Amazon Bedrock는 단일 API로 여러 벤더의 FM을 호출할 수 있게 해주는 완전 관리형 서비스입니다. 인프라 없이 API 호출만으로 FM을 사용하고, 모델 가중치를 직접 관리할 필요가 없습니다.

Anthropic Claude 패밀리

Claude는 현재 Bedrock에서 가장 많이 사용되는 모델 패밀리입니다.

| 모델 | 컨텍스트 | 강점 | 적합한 use case | |------|---------|------|----------------| | Claude 3 Haiku | 200K | 초저지연, 저비용 | 실시간 분류, 키워드 추출, 라우팅 | | Claude 3 Sonnet | 200K | 균형형 | 일반 챗봇, 중간 복잡도 문서 처리 | | Claude 3 Opus | 200K | 최고 품질 | 복잡한 추론, 법률/의학 분석 | | Claude 3.5 Sonnet | 200K | 성능+비용 균형 | 코드 생성, 에이전트 작업 |

Claude가 특히 강한 영역은 복잡한 지시 따르기(instruction following), 안전한 콘텐츠 생성, 긴 문서의 일관성 유지입니다.

Amazon Titan 패밀리

AWS 자체 개발 모델로, Bedrock 내에서 특히 임베딩과 이미지 생성에 자주 사용됩니다.

Titan Text Lite / Express: 가벼운 텍스트 생성, 요약 Titan Embeddings G1 / V2: RAG 파이프라인의 임베딩 생성 Titan Image Generator: 텍스트 기반 이미지 생성 Titan Multimodal Embeddings: 이미지 + 텍스트 통합 임베딩

Titan Embeddings는 AWS 서비스와의 통합이 네이티브하게 최적화되어 있어 Amazon Bedrock Knowledge Bases에서 기본 임베딩 모델로 사용됩니다.

Meta Llama 패밀리

오픈소스 기반으로 커스터마이징이 쉽고, fine-tuning 비용이 상대적으로 저렴합니다.

Llama 2: 13B, 70B 파라미터 옵션 Llama 3: 8B, 70B — 코드, 다국어 지원 강화 Llama 3.1: 8B, 70B, 405B — 대규모 추론 작업

Llama는 도메인 특화 fine-tuning이 필요하거나, 오픈소스 기반의 커스텀 모델이 필요한 환경에 적합합니다.

Mistral 패밀리

유럽 기반의 경량 고효율 모델로, Mixtral 8x7B (MoE 아키텍처)가 대표적입니다.

Mistral 7B: 소형이지만 품질이 뛰어남 Mixtral 8x7B: 8개 전문가 모델(Mixture of Experts) — 70B 급 품질을 7B 비용으로 Mistral Large: 복잡한 추론 작업

MoE(Mixture of Experts) 아키텍처는 토큰마다 활성화되는 전문가 모델이 다르기 때문에, 전체 파라미터 대비 추론 비용이 낮습니다.

Stability AI 와 Cohere

Stable Diffusion XL: 고품질 이미지 생성 Cohere Command: 비즈니스 워크플로 최적화, 다국어 강점 Cohere Embed: 다국어 임베딩, 검색 품질 우수

 

추론 파라미터: temperature, top-p, top-k, max tokens, stop sequences

모델을 선택했다면 다음 단계는 추론 파라미터 튜닝입니다. 같은 모델이라도 파라미터 설정에 따라 결과물의 성격이 크게 달라집니다.

Temperature

는 모델의 "창의성"을 조절합니다. 수학적으로는 소프트맥스 분포의 entropy를 조절하는 파라미터입니다.

| temperature 값 | 특성 | 적합한 use case | |---------------|------|----------------| | 0.0 ~ 0.2 | 결정론적, 반복 일관성 높음 | 코드 생성, 정보 추출, 분류 | | 0.3 ~ 0.7 | 균형형 | 요약, 번역, 질의응답 | | 0.8 ~ 1.0 | 창의적, 다양성 높음 | 브레인스토밍, 마케팅 카피, 소설 |

주의: temperature=0이라도 완전 결정론적이지 않을 수 있습니다. 병렬 처리 환경에서 부동소수점 연산의 비결정성이 개입합니다.

top-p (핵 샘플링)

는 확률 질량의 누적합이 p가 되는 토큰 집합에서만 샘플링합니다. 예를 들어 top-p=0.9이면 확률 상위 90%에 해당하는 토큰만 후보로 사용합니다.

temperature와 top-p를 함께 쓸 때는 보통 하나만 적극 조절합니다. 둘 다 낮게 설정하면 너무 제한적이 되어 반복적인 출력이 발생합니다.

top-k

는 확률 상위 k개 토큰만 후보로 제한합니다. top-k=50이면 매 스텝에서 가장 가능성 높은 50개 토큰 중에서만 선택합니다. 어휘 크기가 큰 모델에서 희귀 토큰의 등장을 억제할 때 유용합니다.

max tokens

는 생성할 최대 토큰 수를 제한합니다. 비용을 통제하는 가장 직접적인 파라미터입니다.

챗봇 응답: 256~512 토큰으로 제한하면 장황한 답변을 방지 코드 생성: 1024~4096 토큰으로 충분한 여유를 줌 문서 요약: 출력 길이를 입력의 20~30% 수준으로 설정

stop sequences

는 특정 문자열이 생성되면 즉시 멈추도록 합니다. 구조화된 출력이 필요할 때 매우 유용합니다.

예를 들어 JSON 출력 파서와 함께 쓸 때 또는 "` 를 stop sequence로 설정하면 코드 블록이나 JSON 이후 불필요한 텍스트 생성을 막을 수 있습니다.

 

Bedrock Model Evaluation Job으로 모델 비교

여러 모델 중 어느 것이 우리 use case에 맞는지 데이터 기반으로 비교하려면 Amazon Bedrock Model Evaluation을 활용합니다.

두 가지 평가 방식

자동 평가(Automatic Evaluation)와 인간 평가(Human Evaluation)를 선택할 수 있습니다.

자동 평가는 빌트인 메트릭을 사용합니다. Accuracy: 정답 레이블과 비교 Robustness: 노이즈가 있는 입력에서의 안정성 Toxicity: 유해 콘텐츠 생성 비율 BERTScore, ROUGE: 텍스트 유사도 측정

인간 평가는 실제 사람이 평가하는 방식으로, Amazon SageMaker Ground Truth Plus 또는 AWS Marketplace의 라벨링 파트너를 활용합니다. 미묘한 품질 차이나 브랜드 톤 일치 여부처럼 자동 메트릭으로 잡기 어려운 측면을 평가할 때 사용합니다.

평가 데이터셋

블로그 목록으로 돌아가기