강화학습·RLHF·모델 평가 지표 완전 가이드

강화학습과 RLHF 개념부터 혼동 행렬, Precision/Recall/F1/AUC-ROC, LLM 평가 지표(ROUGE, Perplexity)까지, 시험에 자주 나오는 평가 지표를 한 번에 정리합니다!

강화학습·RLHF·모델 평가 지표 — 비전공자도 이해하는 완전 가이드

"모델 평가"라는 말을 들으면 막막하게 느껴지시나요? 사실 핵심 원리는 어렵지 않습니다. 시험에서 Recall과 Precision을 언제 쓰는지, 혼동 행렬이 무엇인지를 실생활 비유로 풀어드리겠습니다.

---

 

강화학습 (Reinforcement Learning, RL)

강화학습은 "시행착오 학습"입니다. 게임 캐릭터가 처음에는 벽에 부딪히면서 점점 길을 찾아가는 것과 같습니다.

| 요소 | 설명 | 게임 캐릭터 비유 | |---|---|---| | Agent (에이전트) | 학습하고 결정하는 주체 | 게임 캐릭터 | | Environment (환경) | 에이전트가 상호작용하는 세계 | 게임 맵 | | Action (행동) | 에이전트가 선택하는 것 | 이동, 점프 | | Reward (보상) | 행동에 대한 피드백 | 점수 획득 / 목숨 잃음 | | State (상태) | 현재 환경의 모습 | 캐릭터 현재 위치 | | Policy (정책) | 상태에 따라 행동을 결정하는 전략 | 길이 있으면 앞으로 가기 |

강화학습이 활용되는 곳: 체스·바둑 AI, 로봇 팔 제어, 자율주행, 포트폴리오 관리.

---

 

RLHF — 사람의 피드백으로 AI를 교정하기

RLHF(Reinforcement Learning from Human Feedback)는 ChatGPT가 사람의 의도에 맞게 대화하도록 만든 핵심 기술입니다.

RLHF가 없으면 AI가 "맞지만 불쾌한" 답변을 할 수 있습니다. RLHF는 사람이 좋은 답변/나쁜 답변을 평가하면, 그 기준을 AI가 배우도록 합니다.

4단계 과정:

데이터 수집: 사람이 작성한 좋은 예시 답변을 모읍니다. 초기 파인튜닝: 그 예시로 모델을 기본 학습시킵니다. 보상 모델 구축: 사람이 두 답변 중 더 좋은 것을 선택하면, AI가 인간 선호도 패턴을 학습합니다. 강화학습 최적화: 보상 모델로 전체 시스템을 자동 최적화합니다.

---

 

과적합 vs 과소적합

모델이 잘 안 맞을 때 두 가지 원인 중 하나일 가능성이 높습니다.

시험 공부로 비유하면 이렇습니다.

과소적합(Underfitting): 공부를 너무 안 했다. 연습 문제도 못 풀고, 실제 시험도 못 봄. 과적합(Overfitting): 작년 기출문제만 달달 외웠다. 연습 문제는 완벽한데, 새로운 유형이 나오면 틀림.

| 상태 | 훈련 성능 | 실전 성능 | |---|---|---| | 과적합 (Overfitting) | 매우 좋음 | 나쁨 | | 과소적합 (Underfitting) | 나쁨 | 나쁨 | | 균형 잡힘 (Balanced) | 좋음 | 좋음 |

과소적합 = 높은 편향(High Bias): 모델이 너무 단순 과적합 = 높은 분산(High Variance): 모델이 훈련 데이터에만 집착

---

 

혼동 행렬 (Confusion Matrix)

분류 모델의 성능을 4가지 칸으로 정리한 표입니다.

| | 실제 양성 (YES) | 실제 음성 (NO) | |---|---|---| | 예측 양성 (YES) | TP (맞게 양성 판정) | FP (잘못된 양성 판정) | | 예측 음성 (NO) | FN (놓친 양성) | TN (맞게 음성 판정) |

코로나 검사로 예를 들겠습니다.

TP: 실제 감염자를 양성 판정 — 정답 FP: 비감염자를 양성 판정 — 거짓 경보 FN: 실제 감염자를 음성 판정 — 위험한 오류 (놓침) TN: 비감염자를 음성 판정 — 정답

!혼동 행렬: True/False Positive와 Negative

핵심 평가 지표

정확도 (Accuracy)

전체 중 맞게 예측한 비율입니다. 공식: (TP + TN) / 전체

단점: 데이터 불균형 시 신뢰하기 어렵습니다. 99%가 음성인 데이터셋에서 "무조건 음성"이라고 하면 99% 정확도가 됩니다.

재현율 (Recall / Sensitivity)

실제 양성 중 얼마나 잡아냈는지의 비율입니다. 공식: TP / (TP + FN)

FN(놓친 양성)이 위험할 때 Recall을 올려야 합니다. 암 진단, 사기 탐지가 대표 사례입니다. "한 명도 놓치면 안 된다"는 상황.

정밀도 (Precision)

양성이라고 한 것 중 진짜 양성의 비율입니다. 공식: TP / (TP + FP)

FP(잘못된 양성)가 문제일 때 Precision을 올려야 합니다. 스팸 필터가 중요한 메일을 스팸으로 분류하는 것이 대표 사례입니다. "틀리면 안 된다"는 상황.

F1 스코어

Recall과 Precision의 조화 평균입니다. 공식: 2 × (Precision × Recall) / (Precision + Recall)

데이터가 불균형할 때 둘 다 중요하면 F1을 사용합니다.

정리 표

| 지표 | 무엇을 최소화? | 대표 상황 | |---|---|---| | Recall | FN (놓친 양성) | 암 진단, 사기 탐지 | | Precision | FP (잘못된 양성) | 스팸 필터, 약물 검사 | | F1 Score | 둘 다 균형 | 불균형 데이터셋 | | Accuracy | 전반적 오류 | 균형 데이터셋 |

---

 

AUC-ROC

ROC 곡선은 분류 임계값을 바꿔가며 모델 성능이 어떻게 변하는지를 보여주는 그래프입니다.

AUC = 0.5: 동전 던지기와 같음 (완전 무용) AUC = 1.0: 완벽한 분류기 AUC가 왼쪽 위 모서리에 가까울수록 좋은 모델

---

 

회귀 평가 지표

숫자를 예측하는 모델(집값, 기온 등)은 다른 지표를 씁니다.

| 지표 | 특징 | |---|---| | MAE (평균 절대 오차) | 오차를 절대값으로 평균 | | RMSE (평균 제곱근 오차) | 큰 오차에 더 높은 패널티 | | MAPE (평균 절대 백분율 오차) | 퍼센트로 표현, 스케일 무관 | | R² (결정 계수) | 1에 가까울수록 좋음. 0.8 = 변동의 80% 설명 |

---

 

LLM 전용 평가 지표

퍼플렉시티 (Perplexity)

블로그 목록으로 돌아가기