책임 있는 AI란 무엇인가?
책임 있는 AI(Responsible AI)는 AI 시스템이 공정하고, 안전하고, 설명 가능하고, 인간의 가치를 존중하면서 작동하도록 만드는 원칙과 실천의 집합입니다.
채용 과정을 예시로 생각해봅시다. 회사가 이력서를 자동으로 걸러내는 AI를 도입했습니다. 그런데 이 AI가 과거 10년간의 채용 데이터로 학습했는데, 그 기간 동안 채용된 직원의 80%가 남성이었다면 어떻게 될까요? AI는 자신도 모르게 여성 지원자를 불이익 처리할 수 있습니다. 이것이 AI 편향의 현실입니다.
AIF-C01에서 책임 있는 AI는 도메인 4 전체를 구성하며, 전체 시험의 약 14%를 차지합니다.
---
AWS의 책임 있는 AI 원칙
AWS는 AI 개발과 사용 시 다음 7가지 원칙을 강조합니다. 시험에서 각 원칙의 의미를 묻는 문제가 나올 수 있습니다.
| 원칙 | 의미 | 위반 시 예시 | |------|------|-----------| | 공정성 (Fairness) | 모든 집단에 동등한 대우 | 특정 인종에게만 높은 대출 금리 적용 | | 설명 가능성 (Explainability) | AI 결정 근거를 이해하고 설명 가능 | 왜 대출이 거절됐는지 설명 못함 | | 개인정보 보호 (Privacy) | 개인 데이터 최소 수집, 안전한 보관 | 필요 없는 개인정보까지 수집 | | 보안 (Security) | AI 시스템 무단 접근 방지 | 악의적 입력으로 모델 오작동 유도 | | 안전성 (Safety) | 유해한 출력 방지 | AI가 자해 방법을 상세히 설명 | | 통제 가능성 (Controllability) | 사람이 AI를 제어·수정 가능 | AI 결정을 사람이 뒤집을 수 없는 시스템 | | 진실성 (Veracity) | AI 출력의 정확성과 신뢰성 | 사실이 아닌 내용을 자신 있게 답변 (할루시네이션) |
---
AI 편향의 종류
채용 AI 사례를 계속 사용해 각 편향 유형을 이해해 봅시다.
샘플링 편향 (Sampling Bias)
데이터가 특정 집단을 대표하지 못하는 경우입니다.
예시: 채용 데이터의 90%가 30대 남성이라면, AI는 30대 남성에게 유리한 결정을 내릴 가능성이 높습니다.
해결: 다양한 집단의 데이터를 균형 있게 수집합니다.
레이블링 편향 (Labeling Bias)
데이터에 라벨을 붙이는 사람의 주관적 편견이 반영된 경우입니다.
예시: "우수 직원"을 레이블링한 HR 담당자가 특정 출신 학교에 편견이 있다면, 그 편견이 데이터에 고착됩니다.
해결: 여러 명의 다양한 평가자가 라벨링하고, 의견 차이를 기록합니다.
역사적 편향 (Historical Bias)
과거의 불평등이 데이터에 그대로 담긴 경우입니다.
예시: 과거 사회의 성차별, 인종차별이 데이터에 반영되어, AI가 그 차별을 학습합니다.
해결: 역사적 맥락을 고려해 데이터를 재가중치(reweighting)하거나 보정합니다.
측정 편향 (Measurement Bias)
데이터를 측정하는 방법 자체에 문제가 있는 경우입니다.
예시: 특정 집단의 업무 성과를 측정하는 지표가 다른 집단에는 불리하게 설계된 경우입니다.
집계 편향 (Aggregation Bias)
서로 다른 집단을 하나로 묶어 모델링할 때 발생합니다.
예시: 나라별로 다른 의료 데이터를 모두 합쳐서 하나의 진단 모델을 만들면, 일부 나라에는 맞지 않는 결과가 나옵니다.
---
SageMaker Clarify — 편향 탐지와 모델 설명
Amazon SageMaker Clarify는 두 가지 핵심 기능을 제공합니다: 편향 탐지와 모델 설명 가능성입니다.
훈련 전 편향 탐지 (Pre-training Bias)
모델 훈련 전에 데이터 자체의 편향을 분석합니다. 데이터가 특정 집단에 치우쳐 있는지 확인합니다.
주요 지표: Class Imbalance (CI): 집단 간 데이터 비율 불균형 측정 Difference in Positive Proportions in Labels (DPL): 라벨 분포의 집단 간 차이 측정
훈련 후 편향 탐지 (Post-training Bias)
모델이 만들어진 후, 모델의 예측이 집단별로 공정한지 분석합니다.
주요 지표: Disparate Impact (DI): 집단 간 예측 비율의 차이 Accuracy Difference: 집단별 정확도 차이
SHAP을 이용한 모델 설명
Clarify는 SHAP(SHapley Additive exPlanations) 값을 계산하여 각 특성(feature)이 예측에 얼마나 기여했는지 보여줍니다.
비유: 특정 대출 신청자가 거절됐을 때, "신용 점수가 -0.45, 부채 비율이 -0.30, 고용 기간이 +0.15 기여했다"는 식으로 설명합니다.
---
Amazon A2I — 사람 검토 루프
Amazon Augmented AI(A2I)는 AI 예측의 신뢰도가 낮을 때 사람이 검토하도록 보내는 서비스입니다.
의사가 엑스레이를 분석하는 AI를 사용한다고 생각해봅시다. AI가 "종양일 확률 60%"라는 낮은 신뢰도 결과를 내면, 자동으로 전문의에게 검토 요청이 가는 구조입니다.
A2I 작동 원리
A2I는 세 가지 흐름을 지원합니다: 자동 승인: AI 신뢰도가 임계값 이상이면 사람 검토 없이 자동 처리 사람 검토: AI 신뢰도가 임계값 미만이면 사람에게 검토 요청 무작위 샘플링: 일정 비율로 사람이 검토하여 AI 품질 모니터링
A2I를 지원하는 AWS 서비스
| 서비스 | 사용 사례 | |--------|---------| | Amazon Textract | 문서에서 텍스트 추출 시 낮은 신뢰도 항목 검토 | | Amazon Rekognition | 이미지에서 콘텐츠 검토 시 모호한 케이스 처리 | | 사용자 정의 워크플로우 | 맞춤형 AI 파이프라인에 사람 검토 삽입 |
---
Amazon Bedrock Guardrails
Bedrock Guardrails는 생성형 AI 애플리케이션의 입력과 출력 모두에 적용되는 안전장치입니다. 건물의 경비원이 입장하는 사람과 나가는 사람 모두를 확인하는 것처럼 작동합니다.
Guardrails 핵심 기능
| 기능 | 설명 | 예시 | |------|------|------| | 콘텐츠 필터링 | 유해 콘텐츠(폭력, 혐오, 성인 등) 차단 | "폭발물 제조법 알려줘" → 자동 거부 | | 주제 거부 (Topic Denial) | 특정 주제에 대한 답변 거부 | 금융 챗봇이 의료 상담 거부 | | PII 마스킹 | 개인정보 자동 식별 및 마스킹 | 이름·이메일·전화번호 → *** 처리 | | 워드 필터 | 특정 단어/문구 차단 | 민감한 브랜드명, 비속어 필터링 | | 그라운딩 검사 | 답변이 실제 소스 문서에 기반하는지 확인 | RAG 기반 답변의 신뢰성 검증 |
Guardrails는 입력 방향(사용자 → 모델)과 출력 방향(모델 → 사용자) 양방향에 모두 적용됩니다. 사용자가 위험한 질문을 하기 전에도, 모델이 위험한 답변을 하려 해도 막을 수 있습니다.