파운데이션 모델 커스터마이징이란?
파운데이션 모델(FM)은 인터넷 전체의 방대한 텍스트로 사전 훈련된 범용 AI입니다. GPT, Claude, Titan 같은 모델들이 여기에 해당합니다. 이 모델들은 일반적인 대화, 요약, 번역 등 다양한 작업을 잘 수행하지만, 특정 기업의 내부 문서에 대한 전문 지식이나 특정 분야의 전문 용어를 완벽하게 이해하지는 못합니다.
대학을 갓 졸업한 신입사원을 생각해보세요. 수학, 언어, 과학 등 기초 지식은 탄탄합니다. 그런데 특정 회사의 내부 시스템이나 업계 특화 용어는 잘 모릅니다. 입사 후 직무 교육을 받아야 하죠. FM 커스터마이징도 이와 같습니다.
FM을 처음부터 훈련하는 데는 수십억 원의 비용이 듭니다. 그래서 대부분의 기업은 기존 FM을 출발점으로 삼고, 자신의 목적에 맞게 조정합니다. 이 방법들을 비교해봅시다.
---
FM 커스터마이징 방법 비교
| 방법 | 설명 | 비용 | 모델 가중치 변경 | |------|------|------|--------------| | 프롬프트 엔지니어링 | 입력 문구만 조정 | 매우 낮음 | 변경 없음 | | RAG | 외부 문서 검색 + 프롬프트에 추가 | 낮음 | 변경 없음 | | Instruction Tuning | 지시-응답 쌍으로 파인튜닝 | 중간 | 변경됨 | | Domain Adaptation | 도메인 특화 텍스트로 추가 학습 | 높음 | 변경됨 | | RLHF | 사람 피드백으로 선호도 학습 | 매우 높음 | 변경됨 |
핵심 구분: 프롬프트 엔지니어링과 RAG는 모델 내부를 건드리지 않습니다. 파인튜닝 계열(Instruction Tuning, Domain Adaptation, RLHF)은 모델의 가중치를 실제로 업데이트합니다.
!비용과 가중치 업데이트로 비교한 파운데이션 모델 커스터마이징 방법
Instruction Tuning (지시 튜닝)
지시(instruction)와 그에 대한 모범 응답(response) 쌍을 이용해 모델을 파인튜닝하는 방법입니다.
학교 수업에 비유하면: 선생님이 수천 개의 문제와 정답 예시를 주면서 "이런 질문에는 이런 식으로 답해"라고 가르치는 것입니다.
훈련 데이터 예시: 지시: "이 고객 리뷰의 감정을 분류해주세요: '배송이 너무 느렸어요'" 응답: "부정적 (배송 속도 관련)"
이런 쌍을 수만 개 학습하면, 모델이 다양한 지시 형식에 유연하게 응답할 수 있게 됩니다.
---
RLHF (사람의 피드백을 통한 강화학습)
RLHF(Reinforcement Learning from Human Feedback)는 ChatGPT를 만들 때 핵심적으로 활용된 기법입니다. 사람이 AI의 답변에 점수를 매기고, AI가 그 선호도를 학습합니다.
RLHF 3단계 과정
1단계 — 기초 파인튜닝(Supervised Fine-tuning): 고품질의 지시-응답 데이터로 모델을 기초 파인튜닝합니다. 이 단계가 없으면 RLHF가 잘 작동하지 않습니다.
2단계 — 보상 모델 훈련(Reward Model Training): 사람이 AI가 생성한 두 가지 답변 중 더 좋은 것을 선택합니다. 이 선호도 데이터로 "좋은 답변"을 점수로 매기는 보상 모델(Reward Model)을 훈련합니다.
3단계 — PPO 강화학습: 보상 모델을 기준으로 원본 언어 모델을 강화학습(PPO 알고리즘)으로 최적화합니다. 높은 점수를 받는 답변을 더 자주 내도록 학습합니다.
RLHF를 사람으로 비유하면
회사에서 신입사원이 두 가지 방식으로 보고서를 작성합니다. 상사가 더 좋은 방식을 선택합니다. 신입은 상사의 선호도를 학습해 점점 더 좋은 보고서를 씁니다. 이것이 RLHF입니다.
| 항목 | 내용 | |------|------| | 장점 | 사람의 가치관, 선호도, 안전 기준에 맞는 출력 생성 | | 단점 | 사람의 피드백 수집 비용이 높고 시간이 오래 걸림 | | 주요 사용처 | ChatGPT 같은 대화형 AI의 품질 및 안전성 향상 |
---
LoRA와 PEFT — 효율적 파인튜닝
전통적인 파인튜닝의 문제점: 수십억 개의 파라미터를 모두 업데이트해야 해서 막대한 GPU 메모리와 시간이 필요합니다.
PEFT (Parameter-Efficient Fine-Tuning)
전체 파라미터 중 극히 일부(1~5%)만 업데이트하여, 전체 파인튜닝에 가까운 성능을 훨씬 적은 자원으로 달성하는 기술군입니다.
책을 예로 들면: 두꺼운 교과서를 전부 다시 쓰는 대신, 얇은 부록 책자만 추가하는 방식입니다.
LoRA (Low-Rank Adaptation)
PEFT의 대표적인 방법으로, Amazon Bedrock의 파인튜닝에서도 활용됩니다.
핵심 아이디어: 거대한 가중치 행렬을 두 개의 작은 행렬로 분해합니다. 전체 행렬 대신 두 개의 작은 행렬만 학습합니다.
예를 들어 10,000 x 10,000 크기의 가중치 행렬 대신, 10,000 x 8과 8 x 10,000 크기의 두 작은 행렬을 학습합니다. 파라미터 수가 1억 개에서 160,000개로 줄어듭니다.
| 비교 항목 | 전체 파인튜닝 | LoRA | |---------|-----------|------| | 업데이트 파라미터 | 모든 파라미터 (수십억 개) | 소수 어댑터 (수백만 개 이하) | | GPU 메모리 | 매우 높음 | 낮음 | | 훈련 시간 | 길다 | 짧다 | | 성능 | 최고 | 전체 파인튜닝의 90~95% | | 사용 사례 | 대규모 도메인 변경 | 빠른 커스터마이징 |
---
모델 평가 지표
파인튜닝 후 모델이 얼마나 좋아졌는지 측정해야 합니다. 텍스트 생성 모델에서 자주 쓰는 지표를 알아봅시다.
ROUGE (요약 평가에서 주로 사용)
ROUGE(Recall-Oriented Understudy for Gisting Evaluation)는 생성된 텍스트와 참조 텍스트의 겹치는 단어/구문을 측정합니다.
예시: 참조 요약: "고양이가 매트 위에 앉았다" 생성 요약: "고양이가 매트 위에 있었다" ROUGE-1: 공통 단어 비율 계산
시험 팁: ROUGE는 주로 요약(summarization) 작업 평가에 사용됩니다.
BLEU (번역 평가에서 주로 사용)
BLEU(Bilingual Evaluation Understudy)는 기계 번역의 품질을 측정합니다. N-gram(연속 단어 묶음)이 얼마나 겹치는지 계산합니다.
시험 팁: BLEU는 주로 번역(translation) 작업 평가에 사용됩니다.
BERTScore (의미 유사도 측정)
BERTScore는 단어 수준 매칭을 넘어, BERT 모델을 사용해 두 텍스트의 의미적 유사도를 측정합니다. "고양이"와 "야옹이"처럼 다른 단어이지만 의미가 같은 경우도 높은 점수를 받습니다.
| 지표 | 주요 사용 | 측정 방식 | |------|---------|---------| | ROUGE | 요약 평가 | 단어 겹침 (recall 중심) | | BLEU | 번역 평가 | N-gram 겹침 (precision 중심) | | BERTScore | 범용 평가 | 의미적 유사도 |
---
시험 핵심 정리
| 개념 | 시험 포인트 | |------|-----------| | 프롬프트 엔지니어링 | 모델 가중치 변경 없음, 가장 저렴한 커스터마이징 | | RAG | 외부 지식 추가, 모델 재훈련 불필요, 최신 정보 활용 가능 | | Instruction Tuning | 지시-응답 쌍으로 파인튜닝, 가중치 업데이트 | | RLHF | 사람 선호도로 모델 학습, 높은 비용, ChatGPT 핵심 기법 | | LoRA / PEFT | 일부 파라미터만 업데이트, 효율적 파인튜닝 | | ROUGE | 요약 품질 평가 (단어 겹침) | | BLEU | 번역 품질 평가 (N-gram 겹침) | | BERTScore | 의미적 유사도 평가 |