O Guia Completo do Exame AWS DEA-C01

Cobre o formato do exame DEA-C01, seus quatro domínios, o público-alvo e uma ordem de estudo para iniciantes.

AWS Certified Data Engineer - Associate (DEA-C01) cobre mais terreno do que qualquer outro exame neste blog, com 19 artigos de aprofundamento por domínio para respaldar isso, e com razão. Ele valida o ciclo de vida completo de ingerir, armazenar, operar e proteger dados em uma única certificação. Assim como um centro de distribuição opera recebimento, estoque, expedição e segurança como um único sistema conectado, um engenheiro de dados é dono de tudo desde o momento em que o dado chega até o momento em que termina nas mãos de um analista. A AWS lançou essa certificação em 2023 para reconhecer formalmente a engenharia de dados como sua própria disciplina, e o escopo do exame reflete isso: é consideravelmente mais prático do que as certificações de big data mais antigas que ele substituiu.

Quem Precisa Deste Exame, e uma Visão Geral

Um arquiteto desenha a planta, mas o técnico de sistemas é quem realmente faz água e eletricidade fluírem pelo prédio. O DEA-C01 é a certificação para o técnico que faz os dados realmente fluírem dentro de uma organização. Ele se encaixa com engenheiros de dados que constroem pipelines de ETL, especialistas em processamento em tempo real que trabalham com dados em streaming, e arquitetos que projetam data warehouses e data lakes. Apenas 50 das 65 questões são pontuadas; as outras 15 são questões não pontuadas que a AWS está testando para exames futuros. A taxa do exame é 150 dólares, e a certificação permanece válida por três anos.

 

Formato do Exame: Inspecionar um Pipeline Inteiro em 130 Minutos

Como um check-up de rotina, este exame dedica 130 minutos a percorrer 65 questões que cobrem toda a amplitude da engenharia de dados. A nota de aprovação é 720 de 1000. Ele cobre visivelmente mais serviços da AWS do que outros exames de nível Associate, então mesmo quando nomes como Kinesis, Glue, EMR, Redshift e Athena já são familiares, saber exatamente quando usar cada um é o que realmente determina se você passa.

 

Domínio 1: Ingestão e Transformação de Dados (34%)

Assim como afluentes menores convergem em um rio maior, este domínio cobre reunir dados de fontes variadas e moldá-los em algo utilizável. Tem o maior peso entre todos os domínios, então decide o resultado do exame mais do que qualquer outro, e merece a maior parte do seu tempo de estudo. O essencial é a ingestão de streaming em tempo real com o Kinesis, ETL serverless com o Glue, processamento em larga escala com Spark e Hadoop via EMR, e a orquestração de pipelines junto com conceitos centrais de programação. Oito artigos relacionados cobrem este domínio: Guia Completo de Serviços de Ingestão de Dados, Kinesis Explicado, AWS Glue Explicado, EMR Explicado, Ingestão de Dados em Streaming e em Lote, Transformação e Processamento de Dados, Orquestração de Pipelines de Dados, e Programação, IaC e CI/CD.

 

Domínio 2: Gestão de Armazenamento de Dados (26%)

Assim como um gerente de depósito decide onde os itens ficam e como são categorizados, este domínio cobre decidir qual serviço de armazenamento guarda seus dados e em qual estrutura. O essencial é o data warehousing com o Redshift, escolher o armazenamento certo para uma determinada carga de trabalho, gerenciar metadados através de um catálogo de dados, e políticas de ciclo de vida junto com evolução de esquema. Quatro artigos relacionados cobrem este domínio: Redshift Explicado, Escolhendo e Configurando Armazenamentos de Dados, Sistemas de Catálogo de Dados, e Ciclo de Vida de Dados e Evolução de Esquema.

 

Domínio 3: Operações e Suporte de Dados (22%)

Assim como um controlador de tráfego aéreo observa o status de muitos voos ao mesmo tempo, este domínio cobre confirmar que um pipeline já construído realmente está funcionando bem e analisar os dados que fluem por ele. O essencial são as consultas serverless e a análise com o Athena, monitorar pipelines e gerenciar a qualidade dos dados, e a automação de processos. Quatro artigos relacionados cobrem este domínio: Athena Explicado, Monitoramento de Pipelines e Qualidade de Dados, Análise e Visualização de Dados, e Automação do Processamento de Dados.

 

Domínio 4: Segurança e Governança de Dados (18%)

Um banco não entrega a chave do cofre para qualquer um, e este domínio cobre controlar quem pode tocar nos dados e como, ao longo de todo o pipeline. Tem o menor peso, mas atravessa os outros três domínios por completo. O essencial é o registro de auditoria e a conformidade de privacidade, criptografar e mascarar dados em repouso e em trânsito, e os mecanismos de autenticação e autorização. Três artigos relacionados cobrem este domínio: Logs de Auditoria e Governança de Privacidade de Dados, Criptografia e Mascaramento de Dados, e Mecanismos de Autenticação e Autorização.

 

Uma Ordem de Estudo para Iniciantes, e Erros Comuns

Andar por uma cidade desconhecida sem mapa significa percorrer as mesmas ruas duas vezes, e se preparar para o DEA-C01 sem ordem funciona igualmente mal dado o quão amplo é o conteúdo. Se você é novo em engenharia de dados, comece pelo Domínio 1 (ingestão e transformação), o de maior peso, e experimente Kinesis e Glue direto no console, depois avance para o Domínio 2 (gestão de armazenamento) e organize como o Redshift se diferencia de outras opções de armazenamento. Dali, rode consultas reais no Athena para o Domínio 3 (operações e suporte), e termine somando criptografia e autorização para o Domínio 4 (segurança e governança). O erro mais comum, dada a quantidade de serviços que este exame cobre, é decorar nomes e funções como pares um a um; o exame de verdade adora questões comparativas do tipo "o que se encaixa melhor aqui, Kinesis Data Streams ou Kinesis Data Firehose?". Um segundo erro comum é jogar Glue e EMR juntos sob o rótulo genérico de "serviços de processamento de big data"; a diferença real é se você quer simplicidade serverless ou controle fino sobre o cluster.

 

Resumo do Exame

"Ingere e processa streams de dados em tempo real" -- Amazon Kinesis "Entrega totalmente gerenciada em tempo real para S3 ou Redshift" -- Kinesis Data Firehose "Trabalhos de ETL serverless e um catálogo de dados compartilhado" -- AWS Glue "Clusters gerenciados de Spark e Hadoop para processamento em larga escala" -- Amazon EMR "Data warehouse em escala de petabytes" -- Amazon Redshift "Consultas SQL serverless direto sobre dados no S3" -- Amazon Athena "Um catálogo compartilhado que centraliza metadados" -- AWS Glue Data Catalog "Dados pouco acessados migram para uma camada mais barata" -- políticas de ciclo de vida do S3 "Criptografa dados tanto em repouso quanto em trânsito" -- AWS KMS "Oculta campos sensíveis para minimizar a exposição" -- mascaramento de dados

O DEA-C01 avalia se você consegue escolher o serviço certo para uma situação, não se conhece cada nome de serviço de cor, então o atalho mais seguro para passar é organizar os pares de serviços parecidos em torno da pergunta "quando este, e quando aquele no lugar dele".

Voltar à lista do blog