생성형 AI의 역량과 한계

할루시네이션·비결정성·지식 컷오프 등 생성형 AI의 핵심 한계와 RAG로 대응하는 방법을 초보자도 이해할 수 있게 정리합니다.

AIF-C01 시험에서 생성형 AI의 역량과 한계 도메인은 전체의 약 20%를 차지합니다. 할루시네이션, 비결정성, 컨텍스트 윈도우, 지식 컷오프, 모델 선택 기준이 핵심 주제입니다.

---

 

생성형 AI가 잘하는 것들

생성형 AI는 텍스트, 이미지, 코드, 오디오 등 새로운 콘텐츠를 만들어냅니다. 기존 AI가 "이것이 고양이인가 개인가?"를 판별하는 데 집중했다면, 생성형 AI는 "고양이 사진을 새로 그려줘"를 수행합니다.

| 역량 | 실제 활용 예시 | |------|-------------| | 텍스트 생성 | 이메일 초안, 보고서 요약, 콘텐츠 작성 | | 코드 생성 | Python 함수 자동 작성, 버그 수정 제안 | | 질의응답 | 문서 기반 FAQ 자동 응답 | | 번역 | 한국어 ↔ 영어 실시간 번역 | | 이미지 생성 | 텍스트 설명만으로 이미지 제작 |

하지만 이 능력에는 분명한 한계가 있습니다. 시험에서는 이 한계와 대응 방법을 정확히 알아야 합니다.

---

 

할루시네이션 — AI가 없는 것을 만들어내다

할루시네이션(Hallucination)은 AI가 사실이 아닌 내용을 확신에 찬 어조로 그럴듯하게 생성하는 현상입니다.

자신감 넘치는 친구가 자신도 잘 모르는 것을 아는 척하며 틀린 정보를 당당하게 말하는 경우를 생각해보세요. AI도 마찬가지입니다. 더 무서운 점은 AI는 자신이 틀렸다는 것조차 인식하지 못한다는 것입니다.

왜 할루시네이션이 발생하는가?

모델은 "이런 문맥에서는 이런 텍스트가 이어진다"는 통계적 패턴을 학습합니다. 실제 사실을 기억하는 것이 아니라 패턴을 학습하기 때문에, 학습 데이터에 없는 내용을 물어보면 패턴에 맞는 그럴듯한 내용을 만들어냅니다.

실제 사례: "2027년 AWS re:Invent 날짜를 알려줘" → 모델이 학습하지 않은 미래 정보이므로 그냥 날짜를 지어냅니다.

할루시네이션 완화 방법

| 방법 | 설명 | 효과 | |------|------|------| | RAG (검색 증강 생성) | 외부 문서를 검색해 근거 있는 답변 생성 | 가장 효과적 | | 그라운딩 (Grounding) | 답변을 신뢰할 수 있는 데이터 소스에 연결 | 높음 | | Temperature 낮추기 | 더 보수적이고 일관된 답변 유도 | 중간 | | 인간 검토 루프 | 중요한 결정에 사람이 최종 확인 | 높음 | | 프롬프트 명확화 | 모호한 질문 대신 구체적 질문 | 중간 |

시험 꿀팁: 할루시네이션 완화의 최선책은 RAG입니다.

---

 

비결정성 — 같은 질문, 다른 답변

계산기는 "2+3"을 입력하면 항상 "5"가 나옵니다. 하지만 AI에게 같은 질문을 두 번 하면 다른 답변이 나올 수 있습니다. 이를 비결정성(Nondeterminism)이라고 합니다.

주사위를 던지는 것과 비슷합니다. AI는 다음 단어를 선택할 때 확률적으로 선택합니다. 가장 확률이 높은 단어를 항상 선택하면 딱딱하고 반복적인 답변이 되고, 확률적으로 다양한 단어를 선택하면 창의적이지만 예측하기 어려운 답변이 됩니다.

Temperature — 비결정성을 조절하는 주요 파라미터

| Temperature 범위 | 특성 | 적합한 사용 사례 | |----------------|------|---------------| | 0에 가까움 (0.0~0.2) | 항상 비슷한 예측 가능한 답변 | 법률 문서 요약, 사실 기반 Q&A, 코드 생성 | | 중간 (0.3~0.7) | 균형 잡힌 답변 | 일반 대화, 보고서 작성 | | 높음 (0.8~1.0) | 창의적이고 다양한 답변 | 광고 카피, 소설 아이디어, 브레인스토밍 |

---

 

컨텍스트 윈도우 한계 — AI의 단기 기억

모델이 한 번에 처리할 수 있는 텍스트 길이(토큰 수)에는 상한이 있습니다. 이를 컨텍스트 윈도우(Context Window)라고 합니다.

창문으로 바깥을 보는 상황을 상상해보세요. 창문이 작으면 전체 풍경을 한 번에 볼 수 없습니다. 컨텍스트 윈도우가 작으면 긴 문서나 대화 내용을 한 번에 다루기 어렵습니다.

실용적 의미: 토큰 = 텍스트를 처리하는 최소 단위 (단어 하나가 보통 1~2토큰) 책 한 권(약 10만 단어 = 약 15만 토큰)을 통째로 처리하기 어려울 수 있음 RAG에서 문서를 청킹(작은 조각으로 나누기)하는 이유가 바로 이 한계 때문

컨텍스트 윈도우 크기는 모델마다 다릅니다. 더 큰 윈도우를 가진 모델은 더 긴 문서를 한 번에 처리할 수 있지만, 일반적으로 더 비쌉니다.

---

 

지식 컷오프 — AI가 모르는 최신 정보

모델의 학습 데이터에는 특정 날짜 이후의 정보가 포함되지 않습니다. 이를 지식 컷오프(Knowledge Cutoff)라고 합니다.

2024년에 인쇄된 백과사전을 생각해보세요. 그 이후에 일어난 사건은 실려 있지 않습니다. AI도 마찬가지입니다. 훈련 이후 출시된 AWS 서비스, 최신 뉴스, 최근 연구 결과를 모릅니다.

해결책: RAG를 사용해 최신 문서나 데이터베이스를 실시간으로 검색합니다.

---

 

모델 선택 기준 — 어떤 FM을 골라야 하는가?

모든 상황에 최적인 모델은 없습니다. 프로젝트의 요구사항에 맞게 트레이드오프를 고려해야 합니다.

모델 크기 트레이드오프

| 기준 | 큰 모델 | 작은 모델 | |------|---------|---------| | 정확도 | 높음 | 상대적으로 낮음 | | 응답 속도 | 느림 | 빠름 | | 비용 | 높음 | 낮음 | | 커스터마이징 비용 | 높음 | 낮음 | | 컨텍스트 윈도우 | 보통 큼 | 작을 수 있음 |

모달리티(Modality) — 모델이 처리할 수 있는 데이터 형식

| 모달리티 | 설명 | 예시 | |---------|------|------| | 텍스트 전용 | 텍스트만 입력·출력 | 초기 GPT 모델들 | | 멀티모달 | 텍스트와 이미지를 함께 처리 | Claude 3, GPT-4V | | 코드 특화 | 코드 생성과 이해에 최적화 | Amazon CodeWhisperer |

다국어 지원

영어에 최적화된 모델이 한국어나 아랍어에서는 성능이 낮을 수 있습니다. 다국어 서비스를 구축할 때는 대상 언어에서의 성능을 별도로 검증해야 합니다.

---

 

시험 핵심 정리

"AI가 없는 정보를 자신 있게 그럴듯하게 생성" — 할루시네이션 (Hallucination)

"할루시네이션 완화 최선책" — RAG (검색 증강 생성)

"같은 질문에 매번 다른 답변이 나올 수 있는 특성" — 비결정성 (Nondeterminism)

"Temperature 낮음 (0 근처)" — 일관되고 예측 가능한 답변

"Temperature 높음 (1 근처)" — 창의적이고 다양한 답변

"학습 데이터 이후 최신 정보를 모름" — 지식 컷오프 (Knowledge Cutoff)

"지식 컷오프 해결책" — RAG로 최신 데이터 실시간 검색

"한 번에 처리할 수 있는 최대 토큰 수" — 컨텍스트 윈도우 (Context Window)

"큰 모델의 특성" — 높은 정확도, 느린 속도, 높은 비용

블로그 목록으로 돌아가기