AWS DEA-C01 자격증 완벽 대비 가이드

DEA-C01 시험 형식, 4개 도메인, 응시 대상, 초보자를 위한 학습 순서까지 한 번에 정리합니다.

AWS Certified Data Engineer - Associate(DEA-C01)는 이 블로그에서 다루는 시험 중 도메인 글이 19편으로 가장 많을 만큼 범위가 넓은 자격증입니다. 데이터를 수집하고, 저장하고, 운영하고, 지키는 전 과정을 하나의 자격증으로 검증합니다. 물류센터가 입고부터 재고 관리, 출고, 보안까지 하나의 시스템으로 돌아가듯, 데이터 엔지니어는 데이터가 들어오는 순간부터 분석가의 손에 들어가기까지 전 과정을 책임집니다. AWS는 2023년에 이 자격증을 신설하며 데이터 엔지니어링을 별도 직군으로 인정했는데, 그만큼 시험 범위도 기존 빅데이터 자격증보다 훨씬 실무적입니다.

이 시험이 필요한 사람과 시험 개요

건축가가 설계도만 그린다면 설비 기술자는 실제로 물과 전기가 흐르게 만듭니다. DEA-C01은 데이터가 실제로 조직 곳곳에 흐르게 만드는 기술자의 자격증입니다. ETL 파이프라인을 만드는 데이터 엔지니어, 스트리밍 데이터를 다루는 실시간 처리 담당자, 데이터 웨어하우스와 레이크를 설계하는 아키텍트에게 잘 맞습니다. 65문항 중 50문항만 채점되고 15문항은 향후 시험을 위한 비채점 문항이며, 응시료는 150달러, 유효기간은 3년입니다.

 

시험 형식: 130분 동안 파이프라인 전체를 검사하는 시험

건강검진처럼 이 시험도 130분 동안 65문항으로 데이터 엔지니어링 전 영역을 폭넓게 검사합니다. 합격 기준은 1000점 만점에 720점입니다. 다른 Associate 시험보다 다루는 AWS 서비스 개수가 훨씬 많아서, Kinesis·Glue·EMR·Redshift·Athena처럼 이름은 익숙해도 서로 언제 무엇을 써야 하는지 구분하는 능력이 합격의 관건입니다.

 

도메인 1: 데이터 수집과 변환 (34%)

강물이 여러 지류에서 모여 큰 강이 되듯, 이 도메인은 다양한 원천에서 데이터를 모으고 쓸 수 있는 형태로 다듬는 방법을 다룹니다. 비중이 가장 높아 시험 전체의 성패를 좌우합니다. Kinesis를 통한 실시간 스트리밍 수집, Glue를 통한 서버리스 ETL, EMR을 통한 대규모 Spark·Hadoop 처리, 파이프라인 오케스트레이션과 프로그래밍 개념이 핵심입니다. 관련 글: 데이터 수집 서비스 완벽 정리, Kinesis 완벽 정리, AWS Glue 완벽 정리, EMR 완벽 정리, 스트리밍과 배치 데이터 수집, 데이터 변환과 처리, 데이터 파이프라인 오케스트레이션, 프로그래밍, IaC, CI/CD에서 여덟 편에 걸쳐 다룹니다.

 

도메인 2: 데이터 저장소 관리 (26%)

창고 관리자가 물건을 어디에 쌓을지, 어떻게 분류할지 정하듯, 이 도메인은 데이터를 어떤 저장소에 어떤 구조로 담을지 결정하는 방법을 다룹니다. Redshift를 통한 데이터 웨어하우징, 워크로드에 맞는 저장소 선택, 데이터 카탈로그를 통한 메타데이터 관리, 수명 주기와 스키마 진화가 핵심입니다. 관련 글: Redshift 완벽 정리, 데이터 저장소 선택과 구성, 데이터 카탈로그 시스템, 데이터 수명 주기와 스키마 진화에서 네 편에 걸쳐 다룹니다.

 

도메인 3: 데이터 운영과 지원 (22%)

항공관제사가 여러 비행기의 상태를 동시에 지켜보듯, 이 도메인은 이미 구축된 파이프라인이 잘 돌아가고 있는지 확인하고 그 위에서 데이터를 분석하는 방법을 다룹니다. Athena를 통한 서버리스 쿼리와 분석, 파이프라인 모니터링과 데이터 품질 관리, 처리 자동화가 핵심입니다. 관련 글: Athena 완벽 정리, 파이프라인 모니터링과 데이터 품질, 데이터 분석과 시각화, 데이터 처리 자동화에서 네 편에 걸쳐 다룹니다.

 

도메인 4: 데이터 보안과 거버넌스 (18%)

은행이 금고 열쇠를 아무에게나 맡기지 않듯, 이 도메인은 파이프라인 전체에서 데이터를 누가 어떻게 다룰 수 있는지를 통제하는 방법을 다룹니다. 비중은 가장 낮지만 다른 세 도메인 위에 걸쳐 있는 영역입니다. 감사 로그와 프라이버시 규정 준수, 저장·전송 데이터 암호화와 마스킹, 인증과 권한 부여 메커니즘이 핵심입니다. 관련 글: 감사 로그와 데이터 프라이버시 거버넌스, 데이터 암호화와 마스킹, 인증과 권한 부여 메커니즘에서 세 편에 걸쳐 다룹니다.

 

초보자를 위한 학습 순서와 흔한 실수

지도 없이 낯선 도시를 걸으면 같은 길을 두 번 돌게 됩니다. 데이터 엔지니어링을 처음 접한다면 비중이 가장 높은 도메인 1(수집과 변환)부터 시작해 Kinesis와 Glue를 직접 콘솔에서 다뤄보고, 도메인 2(저장소 관리)로 넘어가 Redshift와 다른 저장소의 차이를 정리하는 순서가 자연스럽습니다. 그다음 도메인 3(운영과 지원)에서 Athena로 실제 쿼리를 날려보고, 마지막으로 도메인 4(보안과 거버넌스)에서 암호화와 권한 부여를 붙이면 전체 그림이 완성됩니다. 가장 흔한 실수는 서비스 개수가 워낙 많다 보니 이름과 기능을 1대1로만 외우고 넘어가는 것인데, 실제 시험은 "이 상황에는 Kinesis Data Streams와 Kinesis Data Firehose 중 무엇이 맞는가" 같은 비교형 질문을 즐겨 냅니다. 또 하나는 Glue와 EMR을 둘 다 "빅데이터 처리 서비스"로 뭉뚱그려 외우는 것인데, 서버리스로 관리 부담을 줄일지 세밀한 제어가 필요한지를 기준으로 구분하는 습관이 필요합니다.

 

시험 핵심 정리

"실시간 데이터 스트림을 수집하고 처리" -- Amazon Kinesis "완전관리형 실시간 스트림을 S3·Redshift로 자동 전달" -- Kinesis Data Firehose "서버리스 ETL 작업과 데이터 카탈로그" -- AWS Glue "관리형 Spark·Hadoop 클러스터로 대규모 처리" -- Amazon EMR "페타바이트급 데이터 웨어하우스" -- Amazon Redshift "S3에 있는 데이터를 SQL로 서버리스 쿼리" -- Amazon Athena "메타데이터를 한곳에서 관리하는 카탈로그" -- AWS Glue Data Catalog "자주 접근하지 않는 데이터는 저렴한 계층으로" -- S3 Lifecycle 정책 "저장 데이터와 전송 데이터 모두 암호화" -- AWS KMS "민감한 데이터를 가려서 노출 최소화" -- 데이터 마스킹

DEA-C01은 서비스 이름을 아는지가 아니라 상황에 맞는 서비스를 고를 수 있는지를 묻는 시험이므로, 비슷해 보이는 서비스 쌍을 "언제 이것을, 언제 저것을" 기준으로 정리해두는 것이 합격의 가장 확실한 지름길입니다.

블로그 목록으로 돌아가기