Azure DP-900 시험 완전 가이드

DP-900 시험 형식과 정형·비정형 데이터, 관계형·비관계형 저장소, Synapse Analytics와 Power BI 분석 흐름을 정리합니다.

azure-dp-900 시험에서 첫 관문은 시험이 정확히 무엇을 확인하려는지 파악하는 일입니다. 처음 클라우드 자격증에 도전하는 사람에게는 시험 범위 자체가 낯설게 느껴질 수 있습니다. 지도 없이 처음 가보는 도시를 걷는 것과 비슷한 느낌입니다. DP-900은 데이터를 다루는 네 가지 큰 영역을 두루 훑는 입문 시험이며, 영역마다 요구하는 사고방식이 조금씩 다릅니다. 네 영역의 경계를 먼저 그려두면, 어디서부터 손을 대야 할지 감이 잡히기 시작합니다.

45분 안에 무엇을 확인하려는 시험인가

건강검진을 받으러 가면 하루 종일 걸리지 않습니다. 정해진 짧은 시간 안에 핵심 지표만 빠르게 훑고 결과를 알려줍니다. DP-900도 비슷합니다. 정식 명칭은 Microsoft AZURE Data Fundamentals이며, 시험 시간은 45분, 문항 수는 50개, 합격 기준은 1000점 만점에 700점입니다.

Fundamentals 레벨답게 사전 자격증이나 실무 경력을 요구하지 않고, 유효기간도 없어 한 번 취득하면 따로 갱신할 필요가 없습니다. 공식 시험 가이드는 Microsoft Learn 페이지(learn.microsoft.com/credentials/certifications/azure-data-fundamentals)에서 확인할 수 있습니다. 문제 대부분은 서비스 이름을 정확히 외우고 있는지보다, 주어진 상황에 어떤 유형의 저장소나 분석 도구가 어울리는지 고르는 방식에 가깝습니다.

 

데이터를 세 가지 서랍에 나누어 담기

이사할 때 짐을 옷장, 서랍, 박스 세 종류로 나누어 담으면 나중에 찾기가 훨씬 쉬워집니다. DP-900도 데이터를 정형(structured), 반정형(semi-structured), 비정형(unstructured) 세 가지로 구분하는 데서 출발합니다.

정형 데이터는 표 형태로 행과 열이 고정된 데이터이고, 반정형 데이터는 JSON처럼 어느 정도 구조는 있지만 표로 딱 떨어지지 않는 데이터, 비정형 데이터는 이미지나 동영상처럼 정해진 스키마가 없는 데이터입니다. 여기에 더해 CSV, JSON, Parquet, ORC, Avro 같은 파일 형식이 각각 어떤 상황에 유리한지도 함께 묻습니다. 이 구분과 파일 형식별 특징을 자세히 정리한 내용은 핵심 데이터 개념 글에서 확인할 수 있습니다.

 

같은 데이터를 다르게 쓰는 사람들

같은 편의점 매출 데이터라도, 계산대 직원은 지금 이 순간 결제가 정상 처리됐는지가 중요하고, 본사 담당자는 지난 한 달간 어떤 상품이 잘 팔렸는지가 중요합니다. 이 시각 차이가 OLTP(Online Transaction Processing)와 OLAP(Online Analytical Processing)를 가릅니다.

OLTP는 매 순간 일어나는 거래를 빠르고 정확하게 기록하는 데 최적화되어 있고, OLAP는 쌓인 데이터를 모아 큰 흐름과 패턴을 분석하는 데 최적화되어 있습니다. 이 위에서 데이터베이스 관리자, 데이터 엔지니어, 데이터 분석가라는 세 역할이 각각 무엇을 책임지는지도 시험 범위에 들어갑니다. 관리자는 시스템을 안정적으로 운영하는 데, 엔지니어는 데이터를 옮기고 가공하는 파이프라인을 만드는 데, 분석가는 그 데이터에서 의미를 뽑아내는 데 집중합니다. 워크로드와 역할 구분을 시나리오 문제로 연습하고 싶다면 데이터 워크로드와 역할 글이 도움이 됩니다.

 

표 안에서 규칙을 지키는 데이터

도서관 대출 카드처럼 이름, 대출일, 반납일이 정해진 칸에 정확히 들어가야 하는 데이터가 있습니다. 이런 데이터는 관계형 데이터베이스에 어울립니다.

관계형 데이터베이스는 정규화를 통해 중복을 줄이고, 기본 키와 외래 키로 테이블 사이의 관계를 정의하며, SQL로 데이터를 조회하고 조작합니다. DP-900은 인덱스가 조회 속도를 어떻게 높이는지, 뷰와 저장 프로시저가 어떤 역할을 하는지도 함께 확인합니다. Azure 위에서는 Azure SQL Database, Azure SQL Managed Instance, Azure Database for MySQL, PostgreSQL, MariaDB처럼 여러 관계형 서비스가 제공되는데, 어떤 서비스가 어떤 상황에 맞는지 고르는 문제가 자주 나옵니다. 정규화 단계와 서비스별 특징은 관계형 데이터 기본 개념 글에서 더 깊게 다뤘습니다.

 

표에 갇히지 않는 데이터

옷장 서랍에는 옷이 잘 들어가지만, 자전거나 캠핑 장비는 서랍보다 창고에 두는 편이 낫습니다. 정해진 스키마에 억지로 맞추기보다 유연하게 저장하는 편이 나은 데이터도 있습니다.

Azure Blob Storage는 이미지, 동영상, 로그 파일 같은 비정형 데이터를 담고, Azure File Storage는 기존 파일 공유를 클라우드로 옮길 때 쓰이며, Azure Table Storage는 스키마가 느슨한 키-값 데이터를 저장합니다. Azure Cosmos DB는 한 단계 더 나아가 전 세계 여러 리전에 데이터를 자동으로 복제하는 전역 분산 데이터베이스이며, Core, MongoDB, Cassandra, Gremlin, Table 다섯 API로 서로 다른 데이터 모델을 지원합니다. 파티션 키를 어떻게 고르느냐에 따라 성능이 크게 달라지고, 처리량은 RU(Request Unit) 단위로 측정됩니다. 이 서비스들의 차이를 더 자세히 보고 싶다면 비관계형 데이터 기본 개념 글이 좋은 출발점입니다.

 

쌓인 데이터가 그림이 되기까지

커피 원두가 매장 진열대에 오르기까지는 수확, 로스팅, 포장, 유통이라는 단계를 거칩니다. 데이터도 마찬가지로 원천에서 모아진 뒤(ETL/ELT), 저장되고, 분석되고, 마지막에 시각화되는 흐름을 거칩니다.

Azure Synapse Analytics와 Microsoft Fabric은 대규모 데이터를 모아 분석하는 통합 플랫폼이고, Azure Databricks는 Spark 기반의 대규모 데이터 처리와 머신러닝에 강하며, Azure Data Factory는 여러 원천의 데이터를 옮기고 변환하는 파이프라인을 구성합니다. 실시간으로 들어오는 데이터, 예를 들어 센서 값이나 클릭 로그를 즉시 처리해야 한다면 Azure Stream Analytics, Event Hubs, IoT Hub 같은 서비스가 등장합니다. 마지막 단계에서 결과를 사람이 이해할 수 있는 형태로 보여주는 도구가 Power BI이며, Desktop에서 보고서를 만들고 Service에서 공유하며 DAX로 계산식을 정의합니다. 대규모 분석과 실시간 처리는 대규모 데이터 분석 서비스와 실시간 데이터 분석 글에서, 시각화는 Power BI 핵심 정리 글에서 이어서 볼 수 있습니다.

 

네 영역을 한 장으로 비교하기

여행 가방을 쌀 때 옷, 세면도구, 전자기기, 서류를 각각 다른 파우치에 나눠 담으면 공항에서 무엇을 어디 뒀는지 헤매지 않습니다. DP-900의 네 영역도 이렇게 구분해두면 시험장에서 문제를 더 빨리 분류할 수 있습니다.

| 영역 | 핵심 질문 | 대표 서비스 | |:--|:--|:--| | 핵심 데이터 개념 | 이 데이터는 정형인가, 반정형인가, 비정형인가 | 개념 중심, 특정 서비스 없음 | | 관계형 데이터 | 표와 관계로 다룰 데이터인가 | Azure SQL Database, Azure Database for MySQL | | 비관계형 데이터 | 유연한 구조나 전역 분산이 필요한가 | Blob Storage, Azure Cosmos DB | | 분석 및 시각화 | 쌓인 데이터를 어떻게 옮기고 분석하고 보여줄 것인가 | Synapse Analytics, Data Factory, Power BI |

처음 준비한다면 핵심 데이터 개념과 워크로드·역할부터 훑어 데이터 자체를 구분하는 눈을 먼저 기르고, 그다음 관계형과 비관계형을 비교하며 저장 방식을 익힌 뒤, 마지막으로 분석과 Power BI로 넘어가는 순서가 자연스럽습니다.

 

시험 핵심 정리

"표 형태로 고정된 행과 열" -- 정형 데이터(Structured Data) "JSON처럼 구조는 있지만 표로 딱 떨어지지 않음" -- 반정형 데이터(Semi-structured Data) "이미지, 동영상처럼 정해진 스키마 없음" -- 비정형 데이터(Unstructured Data) "매 순간의 거래를 빠르고 정확하게 기록" -- OLTP "쌓인 데이터를 모아 패턴 분석" -- OLAP "정규화, 기본 키·외래 키, SQL로 다루는 표 형태 데이터" -- 관계형 데이터베이스 "전 세계 리전에 자동 복제되는 분산 데이터베이스, RU로 처리량 측정" -- Azure Cosmos DB "이미지·동영상·로그 등 비정형 데이터 저장" -- Azure Blob Storage "여러 원천 데이터를 옮기고 변환하는 파이프라인" -- Azure Data Factory "실시간 스트림 데이터 즉시 처리" -- Azure Stream Analytics "보고서 작성부터 공유까지, DAX로 계산식 정의" -- Power BI "45분, 50문항, 700/1000점, 갱신 불필요" -- DP-900 시험 형식

OLTP = 실시간 거래 기록, OLAP = 누적 데이터 분석, Azure Cosmos DB = 전역 분산 비관계형 저장소

네 영역의 큰 그림을 잡았다면, 이제 DP-900 모의고사로 직접 문제를 풀어보며 감각을 확인해볼 차례입니다.

블로그 목록으로 돌아가기