Amazon SageMaker 완전 정복
Amazon SageMaker는 머신러닝의 전체 과정을 하나의 플랫폼에서 처리할 수 있는 AWS의 핵심 서비스입니다. AIF-C01 시험에서 SageMaker 관련 문제가 가장 많이 나옵니다. 이 글에서는 SageMaker의 각 기능을 "어떤 상황에서 쓰이는가"를 중심으로 설명합니다. 처음 접하는 분들도 이해할 수 있도록 구체적인 예시와 함께 정리했습니다.
---
Amazon SageMaker란?
Amazon SageMaker는 데이터 과학자와 개발자가 ML 모델을 빌드, 훈련, 배포할 수 있도록 도와주는 완전 관리형 서비스입니다. "완전 관리형"이란 서버를 직접 구매하거나 설치하지 않아도 된다는 뜻입니다. AWS가 인프라를 자동으로 처리해 줍니다.
SageMaker가 지원하는 ML 전체 흐름: 데이터 수집 및 준비 모델 빌드 및 훈련 하이퍼파라미터 튜닝 모델 배포 성능 모니터링
---
내장 ML 알고리즘
SageMaker는 처음부터 코드를 짜지 않아도 바로 쓸 수 있는 알고리즘을 제공합니다.
| 유형 | 포함된 알고리즘 | |------|----------------| | 지도 학습 | 선형 회귀, 분류, K-최근접 이웃(KNN) | | 비지도 학습 | PCA(차원 축소), K-means 클러스터링, 이상 탐지 | | 특화 알고리즘 | NLP 텍스트 요약, 이미지 분류 및 탐지 |
---
Automatic Model Tuning (AMT)
하이퍼파라미터를 일일이 손으로 바꿔가며 실험하는 것은 매우 시간이 많이 걸립니다. SageMaker AMT는 이 과정을 자동화합니다.
어떻게 동작하냐면, 목표 지표(예: 정확도 최대화)를 정의하면 AMT가 스스로 하이퍼파라미터 범위를 탐색하고 최적 조합을 찾아줍니다. 사람이 수백 번 실험할 일을 자동으로 처리합니다.
시험에서 "하이퍼파라미터를 자동으로 최적화"하는 상황이 나오면 SageMaker AMT를 선택하세요.
---
모델 배포 방식 4가지 비교
시나리오를 읽고 어떤 배포 방식이 적합한지 고르는 문제가 자주 나옵니다. 핵심 기준은 응답 속도가 얼마나 빨라야 하는가, 데이터 크기가 얼마나 큰가입니다.
| 배포 방식 | 응답 속도 | 최대 데이터 크기 | 가장 적합한 사례 | |-----------|-----------|-----------------|-----------------| | 실시간 추론 (Real-Time) | 매우 빠름 (밀리초) | 6 MB | 온라인 사기 탐지, 실시간 추천 | | 서버리스 추론 (Serverless) | 빠름 (콜드 스타트 있음) | 4 MB | 간헐적인 챗봇, 트래픽이 불규칙할 때 | | 비동기 추론 (Async) | 느림 (분~시간) | 1 GB | 의료 영상 분석, 대용량 파일 처리 | | 배치 변환 (Batch Transform) | 가장 느림 | 제한 없음 | 전체 고객 데이터 일괄 예측 |
선택 흐름:
---
SageMaker Studio
SageMaker Studio는 모든 SageMaker 기능을 하나의 화면에서 사용할 수 있는 통합 개발 환경(IDE)입니다. 코드 작성, 실험 추적, 모델 배포, 팀 협업까지 하나의 인터페이스에서 가능합니다.
Data Wrangler, Feature Store, Clarify, Canvas 등 여러 도구들이 Studio 내부에서 동작합니다.
---
SageMaker Data Wrangler
데이터를 정제하고 분석하는 전용 도구입니다. 코딩 없이 시각적으로 데이터를 탐색하고, SQL 쿼리를 실행하고, 데이터를 변환할 수 있습니다.
"ML을 위한 데이터 준비를 한 곳에서" — 이 한 마디가 Data Wrangler의 역할입니다.
---
SageMaker Feature Store
특성(Feature)이란 ML 모델의 입력값입니다. 예를 들어 고객의 나이, 구매 횟수, 지역 같은 정보입니다. Feature Store는 이런 특성들을 중앙에서 저장하고 여러 팀이 재사용할 수 있게 관리합니다.
한 팀이 만든 특성을 다른 팀이 처음부터 다시 만들 필요가 없어집니다. 시간과 리소스를 크게 절약합니다.
---
SageMaker Clarify
Clarify는 두 가지 핵심 기능을 제공합니다.
첫 번째는 편향(Bias) 탐지입니다. 모델이 특정 집단(예: 여성, 특정 인종)에 대해 불공평한 예측을 하고 있는지 통계적으로 측정합니다.
두 번째는 모델 설명 가능성(Explainability)입니다. "왜 이 대출이 거절됐는가?"처럼 모델의 예측 이유를 설명합니다. 규제가 많은 금융, 의료 분야에서 필수적입니다.
---
SageMaker Ground Truth
사람이 데이터에 레이블을 붙이는 작업(어노테이션)을 관리하는 서비스입니다. AI 모델을 훈련시키려면 "이 사진은 고양이다"처럼 정답 레이블이 붙은 데이터가 필요합니다. Ground Truth는 이 레이블링 작업을 체계적으로 관리합니다.
검토자로는 Amazon Mechanical Turk 작업자, 회사 직원, 전문 벤더를 사용할 수 있습니다.
사람이 직접 데이터에 레이블을 붙이는 상황 → Ground Truth 저신뢰도 AI 예측을 사람이 검토하는 상황 → Amazon A2I (두 가지를 구분하세요)
---
ML 거버넌스 도구
SageMaker Model Cards는 모델의 목적, 위험 등급, 훈련 정보를 공식 문서로 남기는 도구입니다.
SageMaker Role Manager는 데이터 과학자, MLOps 엔지니어 등 직무별로 SageMaker 접근 권한을 정의합니다.
---
SageMaker Model Dashboard
배포된 모든 모델을 하나의 화면에서 볼 수 있는 중앙 포털입니다. 데이터 품질, 모델 성능, 편향, 설명 가능성 기준을 위반한 모델을 빠르게 찾아냅니다.