Guia Completo do Exame AWS MLA-C01
AWS Certified Machine Learning Engineer - Associate (MLA-C01) é uma certificação lançada em 2024 que se distingue claramente da sua antecessora MLS-C01. Enquanto a MLS-C01 era voltada para cientistas de dados e pesquisadores, a MLA-C01 é projetada para engenheiros que constroem e operam sistemas de ML em produção. O exame não termina no treinamento do modelo: ele avalia como implantar, monitorar, proteger e otimizar custos em todo o ciclo de vida do ML na AWS.
Se você já construiu pipelines de ML em produção, reconhecerá os problemas que o exame avalia. Os quatro domínios refletem quase diretamente as fases de um projeto de ML real, com o SageMaker como fio condutor de todos eles.
Especificações do Exame
| Item | Detalhes | |------|---------| | Código do exame | MLA-C01 | | Total de questões | 65 (50 pontuadas + 15 não pontuadas) | | Duração | 170 minutos | | Pontuação mínima | 720 de 1000 | | Custo | $150 USD | | Tipos de questões | Resposta única e resposta múltipla | | Validade | 3 anos | | Experiência recomendada | 1+ ano de experiência prática em engenharia de ML |
Com 170 minutos para 65 questões, você tem aproximadamente 2 minutos e 37 segundos por questão. As 15 questões não pontuadas não são identificadas, então trate cada questão com a mesma atenção. As questões de resposta múltipla exigem leitura cuidadosa.
Distribuição dos Quatro Domínios
| Domínio | Nome | Peso | |---------|------|------| | D1 | Preparação de dados para ML | 28% | | D2 | Desenvolvimento de modelos de ML | 26% | | D3 | Implantação e orquestração de fluxos de ML | 22% | | D4 | Monitoramento, manutenção e segurança de soluções ML | 24% |
D1 tem o maior peso, refletindo a realidade do trabalho diário: a preparação de dados e a engenharia de features consomem entre 60% e 80% do esforço em projetos reais de ML. D4, com 24%, mostra que a operação responsável de modelos em produção é tão importante quanto construí-los.
!Peso dos domínios do exame MLA-C01
Detalhes de cada Domínio
D1: Preparação de Dados para ML (28%)
Cobre a entrada do pipeline de ML. Os três subtemas são ingestão e armazenamento de dados, transformação e engenharia de features, e qualidade e governança de dados.
Para ingestão e armazenamento, trabalha-se com S3, Kinesis Data Streams, Kinesis Firehose, Glue Data Catalog e Lake Formation. Para transformação, SageMaker Data Wrangler, SageMaker Processing, Glue ETL e SageMaker Feature Store são as ferramentas centrais. Para qualidade e governança, o foco está em detectar data drift, identificar vieses em datasets e rastrear a linhagem dos dados.
D2: Desenvolvimento de Modelos de ML (26%)
Este domínio foca no uso efetivo das capacidades de treinamento do SageMaker, mais do que em teoria de algoritmos. SageMaker JumpStart e Autopilot representam diferentes pontos de entrada: JumpStart fornece modelos pré-treinados para fine-tuning, enquanto Autopilot automatiza a seleção e treinamento a partir de dados brutos. SageMaker Clarify gerencia detecção de vieses e explicabilidade, enquanto Debugger inspeciona tensores durante o treinamento.
D3: Implantação e Orquestração (22%)
Os quatro modos de inferência são tópico frequente no exame: Real-time Endpoints para inferência síncrona de baixa latência, Batch Transform para grandes datasets offline, Serverless Inference para cargas de trabalho infrequentes e Async Inference para payloads grandes com resposta assíncrona. O SageMaker Model Registry gerencia versões e fluxos de aprovação entre desenvolvimento e implantação.
D4: Monitoramento, Manutenção e Segurança (24%)
SageMaker Model Monitor detecta data drift e model drift em tempo real. Os tópicos de segurança incluem funções IAM com mínimo privilégio, criptografia KMS, isolamento em VPC e PrivateLink. A otimização de custos inclui Managed Spot Training para até 90% de economia em trabalhos de treinamento.
O Ecossistema SageMaker
A mudança de perspectiva mais importante para o MLA-C01 é entender que o SageMaker não é um serviço único, mas uma plataforma com dezenas de componentes que cobrem cada etapa do ciclo de vida do ML. Uma vez que você tem o mapa do SageMaker na cabeça, os quatro domínios começam a parecer quatro visões do mesmo fluxo de trabalho.
| Componente SageMaker | Domínio | Papel Principal | |--------------------|---------|----------------| | Data Wrangler | D1 | Transformação de dados sem código | | Feature Store | D1 | Armazenamento de features online e offline | | Processing | D1, D2 | Jobs de pré-processamento em larga escala | | JumpStart | D2 | Modelos pré-treinados e templates de soluções ML | | Autopilot | D2 | Geração automática de pipelines AutoML | | Clarify | D2, D4 | Detecção de vieses e explicabilidade | | Model Registry | D3 | Versionamento e aprovação de modelos | | Pipelines | D3 | Orquestração de fluxos de trabalho ML | | Model Monitor | D4 | Monitoramento de qualidade do modelo em produção |
Dicas para o Exame
"Data drift vs model drift" -- Data drift é uma mudança na distribuição das features de entrada. Model drift é uma degradação na qualidade de predição para entradas similares. O SageMaker Model Monitor detecta ambos. "Escolha do modo de inferência" -- Real-time para baixa latência, Async para payloads grandes, Serverless para tráfego esporádico, Batch Transform para datasets offline. O padrão de tráfego do cenário guia a resposta. "Feature Store: online vs offline" -- O armazenamento online serve leituras de latência em milissegundos para inferência em tempo real. O armazenamento offline suporta o treinamento em batch. A maioria dos sistemas em produção usa ambos simultaneamente. "Managed Spot Training" -- Até 90% de redução de custos. Requer checkpointing no S3 para que trabalhos interrompidos possam ser retomados. "SageMaker Pipelines vs Step Functions" -- Pipelines é nativo de ML com etapas de primeira classe para SageMaker. Step Functions é mais amplo e preferido quando se combinam serviços como Lambda, ECS e outros em um mesmo fluxo. "SageMaker Neo" -- Compilação e otimização de modelos para hardware específico, incluindo dispositivos edge. Aparece em cenários de IoT e inferência na borda.
Considerações Finais
MLA-C01 é uma certificação prática que recompensa engenheiros que trabalharam em pipelines de ML reais. A abordagem de estudo mais eficaz é traçar um projeto de ML completo desde os dados brutos até a implantação em produção com monitoramento ativo, identificando qual serviço AWS gerencia cada etapa e por quê. Quando você consegue percorrer esse fluxo com confiança, as questões baseadas em cenários do exame se tornam muito mais acessíveis.
---
Série de Aprofundamento por Domínio e Próximos Passos
Com o panorama completo deste guia, continue com os posts de aprofundamento abaixo para desenvolver o critério em nível de serviço para cada domínio.
| | Tópico | |---|--------| | 2 | Ingestão e Armazenamento de Dados | | 3 | Engenharia de Features e Qualidade de Dados | | 4 | Escolha da Abordagem de Modelagem | | 5 | Treinamento, Ajuste e Avaliação de Modelos | | 6 | Infraestrutura de implantação e estratégias de escalabilidade | | 7 | Construindo pipelines MLOps e CI/CD | | 8 | Monitoramento de Modelos, Otimização de Custos e Segurança |
Pronto para saber onde você está? Experimente agora o exame de prática do MLA-C01.