AWS MLA-C01 시험 완전 정복 가이드: 머신러닝 엔지니어 어소시에이트

AWS Certified Machine Learning Engineer - Associate(MLA-C01) 시험 구조, 4개 도메인, 핵심 서비스, 배경별 학습 전략까지 한눈에 정리하는 완전 가이드입니다.

AWS MLA-C01 시험 완전 정복 가이드

AWS Certified Machine Learning Engineer - Associate, 줄여서 MLA-C01은 2024년에 새롭게 등장한 자격증입니다. 기존의 MLS-C01(Machine Learning Specialty)이 데이터 사이언티스트와 연구자를 주요 대상으로 했다면, MLA-C01은 ML 시스템을 실제로 구축하고 운영하는 엔지니어를 위한 자격증입니다. 즉, 모델을 만드는 것에서 끝나지 않고 모델을 배포하고, 모니터링하고, 비용 효율적으로 유지하는 전체 사이클을 다룹니다.

이 자격증은 "SageMaker를 얼마나 잘 다루는가"를 넘어, ML 워크플로 전체를 AWS 서비스들로 어떻게 오케스트레이션하는지를 묻습니다. 실무에서 ML 파이프라인을 만들어본 엔지니어라면 공부하면서 "아, 이게 바로 내가 하던 일이구나"라는 감각을 많이 느끼게 될 것입니다.

 

시험 기본 정보

| 항목 | 내용 | |------|------| | 시험 코드 | MLA-C01 | | 총 문항 수 | 65문항 (채점 50문항 + 비채점 15문항) | | 시험 시간 | 170분 | | 합격 점수 | 1000점 만점 중 720점 이상 | | 응시 비용 | $150 USD | | 문제 유형 | 단일 정답 선택형 + 복수 정답 선택형 | | 유효 기간 | 3년 | | 권장 경력 | ML 엔지니어링 분야 1년 이상 실무 경험 |

170분에 65문항이니 문항당 평균 2분 37초가 주어집니다. 복수 정답 선택형 문항이 포함되어 있어 신중하게 읽어야 하지만, 과도하게 시간을 끌 필요는 없습니다. 시험 중 비채점 문항 15개는 어떤 문항인지 표시되지 않으므로, 모든 문항을 동일하게 접근하는 것이 좋습니다.

 

4개 도메인 구성

MLA-C01의 시험 범위는 4개 도메인으로 구성됩니다. 각 도메인의 비율은 실제 ML 프로젝트에서의 중요도를 반영합니다.

| 도메인 | 이름 | 출제 비율 | |--------|------|----------| | D1 | ML을 위한 데이터 준비 | 28% | | D2 | ML 모델 개발 | 26% | | D3 | ML 워크플로 배포 및 오케스트레이션 | 22% | | D4 | ML 솔루션 모니터링, 유지보수, 보안 | 24% |

D1이 가장 비중이 높습니다. 현업에서도 마찬가지입니다. 데이터 준비와 피처 엔지니어링에 전체 ML 프로젝트 시간의 60~80%가 소요된다는 것은 잘 알려진 사실이고, AWS는 이 현실을 시험에 그대로 반영했습니다. D4의 보안과 모니터링 영역(24%)도 무시할 수 없는 비중입니다. 모델을 배포한 후에 어떻게 책임감 있게 운영하는지를 중요하게 봅니다.

!MLA-C01 시험 도메인 비중

도메인별 세부 내용

D1: ML을 위한 데이터 준비 (28%)

이 도메인은 ML 파이프라인의 입구를 다룹니다. 데이터를 어디서 가져오고, 어떻게 저장하고, 어떻게 변환하여 모델이 학습할 수 있는 형태로 만드는지를 묻습니다.

세부 주제는 세 가지입니다. 첫째, 데이터 수집 및 저장으로 S3, Kinesis Data Streams, Kinesis Firehose, Glue Data Catalog, Lake Formation을 활용한 데이터 레이크 구성이 핵심입니다. 둘째, 데이터 변환 및 피처 엔지니어링으로 SageMaker Data Wrangler, SageMaker Processing, Glue ETL, SageMaker Feature Store 등이 중심입니다. 셋째, 데이터 품질 및 거버넌스로 데이터 드리프트 감지, 편향 검출, 데이터 계보 추적 등을 다룹니다.

D2: ML 모델 개발 (26%)

모델을 어떻게 선택하고 훈련하고 평가하는지를 다룹니다. 알고리즘 이론보다는 SageMaker의 다양한 훈련 기능을 실제로 어떻게 활용하는지에 초점이 맞춰져 있습니다.

세부 주제는 모델링 접근법 선택(SageMaker JumpStart, Autopilot, Built-in Algorithms), 모델 훈련 및 튜닝(분산 훈련, SageMaker Hyperparameter Tuning, SageMaker Experiments), 모델 분석 및 평가(SageMaker Clarify, SageMaker Debugger, 모델 카드)입니다.

D3: ML 워크플로 배포 및 오케스트레이션 (22%)

훈련된 모델을 프로덕션에 올리는 과정 전체를 다룹니다. 배포 방식 선택, 인프라 구성, CI/CD 자동화가 핵심 주제입니다.

세부 주제로는 배포 인프라 선택(SageMaker Real-time Endpoints, Batch Transform, Serverless Inference, Async Inference), ML 인프라 스케일링 및 구성(Auto Scaling, Multi-model Endpoints, SageMaker Neo), CI/CD 파이프라인 및 오케스트레이션(SageMaker Pipelines, Step Functions, CodePipeline, CodeBuild, EventBridge)이 있습니다.

D4: ML 솔루션 모니터링, 유지보수, 보안 (24%)

배포 후의 운영 단계를 다룹니다. 모델 성능 저하를 감지하고, 비용을 최적화하고, 규정 준수 요건을 충족하는 방법을 묻습니다.

세부 주제는 모델 추론 모니터링(SageMaker Model Monitor, CloudWatch, X-Ray를 통한 데이터 드리프트 및 모델 드리프트 감지), 인프라 및 비용 최적화(Spot 인스턴스 활용, 인스턴스 타입 선택, SageMaker Savings Plans), ML 솔루션 보안(IAM 역할 최소 권한, KMS 암호화, VPC 격리, PrivateLink, CloudTrail 감사)입니다.

 

SageMaker 생태계: 모든 도메인의 중심

MLA-C01을 준비하면서 가장 중요한 인식은 이것입니다. Amazon SageMaker는 단일 서비스가 아니라 하나의 플랫폼 생태계입니다. 각 도메인의 핵심 서비스들이 SageMaker 아래 하위 기능으로 묶여 있어서, SageMaker의 전체 구조를 먼저 이해하면 4개 도메인 모두에 걸쳐 이점을 얻을 수 있습니다.

| SageMaker 기능 | 해당 도메인 | 핵심 역할 | |----------------|-----------|----------| | Data Wrangler | D1 | 노코드 데이터 변환 및 피처 엔지니어링 | | Feature Store | D1 | 피처 저장소 (온라인/오프라인) | | Processing | D1, D2 | 대규모 데이터 전처리 작업 | | Built-in Algorithms | D2 | 최적화된 AWS 제공 알고리즘 | | JumpStart | D2 | 사전 훈련된 모델 및 솔루션 허브 | | Autopilot | D2 | AutoML (자동 모델 선택 및 훈련) | | Hyperparameter Tuner | D2 | 자동화된 하이퍼파라미터 최적화 | | Experiments | D2 | 실험 추적 및 비교 | | Debugger | D2 | 훈련 중 텐서 분석 및 디버깅 | | Clarify | D2, D4 | 편향 감지 및 모델 설명 가능성 | | Model Registry | D3 | 모델 버전 관리 및 승인 워크플로 | | Pipelines | D3 | ML 워크플로 오케스트레이션 | | Real-time Endpoints | D3 | 실시간 추론 엔드포인트 | | Batch Transform | D3 | 대용량 배치 추론 | | Serverless Inference | D3 | 서버리스 추론 (간헐적 트래픽) | | Async Inference | D3 | 비동기 추론 (대용량 페이로드) | | Neo | D3 | 엣지 디바이스용 모델 최적화 | | Model Monitor | D4 | 프로덕션 모델 드리프트 모니터링 |

 

ML 워크플로 관점으로 보는 MLA-C01

시험을 4개 도메인으로 쪼개서 외우는 것보다, 실제 ML 프로젝트 흐름을 따라 서비스들을 연결해서 이해하는 것이 훨씬 효과적입니다.

실제 ML 프로젝트는 이렇게 흘러갑니다. 원시 데이터가 S3나 Kinesis를 통해 수집됩니다. Glue나 Lake Formation이 데이터를 카탈로그화하고 관리합니다. SageMaker Data Wrangler나 Processing이 데이터를 정제하고 피처로 변환합니다. 변환된 피처는 SageMaker Feature Store에 저장되어 훈련과 추론 양쪽에서 재사용됩니다. SageMaker Training이 모델을 훈련하고, Clarify와 Debugger가 모델을 분석합니다. 검증된 모델은 Model Registry에 등록되고, Pipelines가 이 전체 흐름을 자동화합니다. 배포는 트래픽 패턴에 따라 Real-time, Batch, Serverless, Async 중 적합한 방식으로 이루어집니다. 배포 후에는 Model Monitor가 데이터 드리프트와 모델 드리프트를 지속적으로 감시합니다. CloudWatch와 X-Ray가 인프라 수준의 모니터링을 담당합니다.

이 흐름을 머릿속에 그릴 수 있다면, 시험 문제가 어느 단계를 묻는지 즉시 파악하고 관련 서비스를 떠올리는 것이 수월해집니다.

 

배경별 학습 전략

데이터 사이언티스트 배경

모델 훈련과 평가(D2)는 이미 익숙할 것입니다. 상대적으로 취약한 부분은 배포 인프라(D3)와 MLOps(D3, D4)입니다. SageMaker Pipelines, CodePipeline과의 연동, 그리고 다양한 추론 엔드포인트 유형(Real-time, Batch, Serverless, Async)의 차이를 집중적으로 공부하세요. 또한 비용 최적화 전략, 특히 Spot 인스턴스와 관리형 Spot 훈련에 대해서도 익혀두어야 합니다.

백엔드/DevOps 엔지니어 배경

CI/CD 파이프라인 구성(D3)과 보안(D4)은 강점이 될 것입니다. ML 특화 서비스들, 특히 SageMaker Feature Store, Data Wrangler, Model Monitor 같은 도구들의 개념과 사용 시나리오를 집중적으로 파악하세요. 피처 스토어의 온라인/오프라인 개념, 데이터 드리프트와 모델 드리프트의 차이, SageMaker Clarify의 편향 보고서 해석 방법을 중점적으로 학습하세요.

AWS 서비스 전반 경험자

SageMaker 외부 서비스들(S3, Kinesis, Glue, Lambda, Step Functions 등)과 SageMaker의 연동 패턴을 잘 알고 있다면 유리합니다. ML 개념 자체(알고리즘 선택 기준, 하이퍼파라미터 의미, 평가 지표)를 보강하는 것이 중요합니다. 특히 XGBoost, 선형 모델, 딥러닝의 적용 시나리오 차이와 SageMaker Built-in 알고리즘들의 특징을 파악하세요.

 

시험 준비 핵심 팁

"데이터 드리프트 vs 모델 드리프트" -- 데이터 드리프트는 입력 데이터의 분포 변화, 모델 드리프트는 동일 입력에 대한 예측 품질 저하. SageMaker Model Monitor가 둘 다 감지. "Real-time vs Async vs Serverless vs Batch Transform" -- 저지연 소량 요청은 Real-time, 대용량 페이로드는 Async, 간헐적 트래픽은 Serverless, 오프라인 대량 처리는 Batch Transform. "SageMaker Feature Store 온라인 vs 오프라인" -- 온라인 스토어는 밀리초 단위 실시간 추론용, 오프라인 스토어는 배치 훈련용. 둘 다 동시에 쓰는 것이 일반적 패턴. "Managed Spot Training" -- 훈련 비용 최대 90% 절감 가능. 체크포인트를 S3에 저장해 중단 시 재개 가능하도록 설정하는 것이 핵심. "SageMaker Pipelines vs Step Functions" -- Pipelines는 ML 특화 오케스트레이션(훈련, 처리, 평가 단계 중심), Step Functions는 범용 워크플로(Lambda, ECS 등 다양한 서비스 연동 시 유리). "VPC 격리" -- SageMaker 훈련 및 추론 인스턴스를 VPC 내에 배치하고 인터넷 접근을 차단하는 것이 보안 모범 사례. PrivateLink로 AWS 서비스에 비공개 접근. "SageMaker Clarify" -- 훈련 전 데이터 편향 감지 + 훈련 후 모델 편향 감지 + SHAP 기반 설명 가능성 보고서. 공정성과 투명성 요건 충족 용도. "SageMaker Neo" -- 모델을 특정 하드웨어(엣지, 클라우드 인스턴스)에 최적화. 추론 속도 향상 및 모델 크기 감소. IoT/엣지 시나리오에서 자주 등장. "Multi-model Endpoint" -- 유사한 여러 모델을 하나의 엔드포인트에서 서빙. 비용 효율적. 모델이 자주 전환되지 않는 경우 적합. "SageMaker Autopilot vs JumpStart" -- Autopilot은 데이터만 주면 자동으로 최적 모델 탐색(AutoML), JumpStart는 사전 훈련된 파운데이션 모델을 가져다 파인튜닝하거나 바로 배포.

 

마무리

MLA-C01은 ML 실무자에게 AWS 생태계 내에서의 엔지니어링 역량을 검증받는 좋은 기회입니다. 이 자격증을 준비하는 과정 자체가 SageMaker의 다양한 기능들을 체계적으로 이해하는 계기가 되고, 실무에서 ML 파이프라인을 설계할 때 더 나은 아키텍처 결정을 내리는 데 도움이 됩니다.

4개 도메인을 독립된 섹션으로 외우기보다, 데이터 수집부터 모델 모니터링까지 이어지는 하나의 흐름으로 이해하는 것을 권장합니다. 각 서비스가 워크플로의 어느 단계에서 무슨 문제를 해결하는지 명확히 알면, 시험 문제의 시나리오가 어떤 서비스를 가리키는지 자연스럽게 판단할 수 있게 됩니다.

---

 

도메인 심화 시리즈와 다음 단계

이 가이드로 전체 그림을 잡았다면, 아래 심화 글로 이어가며 각 서비스의 실전 판단 기준을 채워보세요.

| | 주제 | |---|------| | 2 | 데이터 수집과 저장 전략 | | 3 | 피처 엔지니어링과 데이터 품질 | | 4 | 모델링 접근법 선택 | | 5 | 모델 훈련·튜닝·평가 | | 6 | 배포 인프라와 스케일링 전략 | | 7 | MLOps와 CI/CD 파이프라인 구축 | | 8 | 모델 모니터링, 비용 최적화, 보안 |

실전 감각을 점검하고 싶다면 MLA-C01 모의고사로 지금 바로 확인해보세요.

블로그 목록으로 돌아가기