AWS MLA-C01 D4 em Profundidade: Monitoramento de Modelos, Otimização de Custos e Segurança
Acreditar que o trabalho termina quando um modelo vai para produção é um erro perigoso. Esse momento é na verdade quando o trabalho real começa. Modelos em produção se degradam silenciosamente com o tempo. As distribuições de features mudam, o significado dos rótulos se altera, e surgem padrões que o modelo nunca viu durante o treinamento. Se você não perceber, o negócio gradualmente passa a depender de previsões cada vez mais incorretas.
O Domínio 4 do MLA-C01 valida sua capacidade de operar sistemas de ML de forma responsável ao longo de todo o ciclo de vida em produção. Com 24% do peso do exame, está dividido em Tarefa 4.1 (Monitoramento de Inferência de Modelos), Tarefa 4.2 (Otimização de Infraestrutura e Custos) e Tarefa 4.3 (Segurança de Soluções ML).
Tarefa 4.1: Monitoramento de Inferência de Modelos
Por que os modelos se degradam com o tempo
A lacuna entre dados de treinamento e dados de produção é chamada de drift. O drift existe em múltiplas camadas. O data drift significa que a distribuição estatística das features de entrada muda. O concept drift é uma mudança mais profunda: o relacionamento entre features de entrada e o rótulo alvo muda. O feature attribution drift é medido através de mudanças nos valores SHAP.
O SageMaker Model Monitor fornece quatro tipos de monitores para detectar essas formas de drift.
| Tipo de Monitor | Detecta | Criação de Baseline | |-----------------|---------|---------------------| | Data Quality Monitor | Mudanças na distribuição de features | Estatísticas do dataset de treinamento | | Model Quality Monitor | Mudanças na precisão de previsões | Comparar previsões com rótulos reais | | Bias Drift Monitor (Clarify) | Mudanças no viés de previsão | Baseline de viés do Clarify | | Feature Attribution Drift Monitor (Clarify) | Mudanças na distribuição SHAP | Baseline SHAP do Clarify |
Para que o Model Monitor funcione, o endpoint deve capturar entradas e saídas de inferência via Data Capture. Um job do SageMaker Processing gera o baseline com estatísticas do dataset de treinamento. Os cronogramas de monitoramento comparam regularmente os dados capturados contra esse baseline e registram violações no S3. Alarmes do CloudWatch conectados a esses registros notificam você quando drift é detectado.
!Os 4 tipos do SageMaker Model Monitor
A/B Testing e Shadow Testing
Para validar se um novo modelo é melhor, o SageMaker oferece duas abordagens. O A/B Testing usa variantes de produção com pesos de tráfego atribuídos. O Shadow Testing é mais seguro: o novo modelo processa requisições reais mas suas respostas não são retornadas aos usuários, apenas avaliadas em segundo plano. O tráfego só é transferido após validação suficiente.
Tarefa 4.2: Infraestrutura e Otimização de Custos
Observando endpoints com CloudWatch
Os endpoints do SageMaker publicam automaticamente métricas essenciais no CloudWatch. ModelLatency é o tempo de inferência do modelo. OverheadLatency é a latência adicional da infraestrutura do SageMaker. InvocationsPerInstance é a métrica chave para Auto Scaling. GPUUtilization e MemoryUtilization ajudam a avaliar o dimensionamento de instâncias.
Para pipelines de ML que abrangem múltiplos serviços, o AWS X-Ray fornece rastreamento distribuído para identificar gargalos. O CloudWatch Logs Insights permite consultar logs de contêineres do SageMaker em tempo real para depurar falhas.
Estratégias de Otimização de Custos
Para treinamento, o SageMaker Managed Spot Training reduz custos em até 90% usando Spot Instances, com o SageMaker gerenciando automaticamente interrupções e retomadas via checkpoints no S3.
Para inferência, a estratégia depende do padrão de tráfego. Serverless Inference elimina custos de ociosidade para tráfego intermitente. O Batch Transform encerra instâncias automaticamente ao completar o processamento. Multi-model Endpoints permitem que múltiplos modelos compartilhem uma instância. O SageMaker Inference Recommender seleciona automaticamente o tipo de instância ideal.
O SageMaker Savings Plans oferece até 64% de desconto sobre preços on-demand com compromissos de 1 ou 3 anos. Tags consistentes de recursos, AWS Budgets e AWS Cost Explorer fornecem visibilidade de custos por projeto e equipe.
Tarefa 4.3: Segurança de Soluções ML
IAM, VPC e Criptografia KMS
O execution role do SageMaker deve seguir o princípio de menor privilégio, limitando o acesso a buckets S3 específicos, chaves KMS específicas e operações SageMaker específicas. O SageMaker Role Manager orienta a criação de roles de menor privilégio por persona de ML.
O isolamento em VPC coloca cargas de trabalho de ML em sub-redes privadas. Configurar bloqueia completamente o acesso à internet do contêiner de treinamento. Os VPC endpoints (PrivateLink) permitem comunicação com serviços AWS sem atravessar a internet.
A criptografia KMS protege dados em repouso (S3, volumes EBS, artefatos de modelos) e em trânsito com TLS. Configurar criptografa a comunicação entre nós no treinamento distribuído. As chaves gerenciadas pelo cliente (CMK) oferecem maior controle sobre rotação e auditoria.
CloudTrail e Registro de Auditoria
O CloudTrail registra todas as chamadas de API do SageMaker para rastrear quem iniciou qual job de treinamento ou modificou qual endpoint. O ML Lineage Tracking registra automaticamente os relacionamentos entre execuções de treinamento, datasets e artefatos de modelos, essencial para ambientes regulados.
Para pipelines CI/CD de ML, os segredos devem ser armazenados no AWS Secrets Manager ou no Systems Manager Parameter Store, nunca codificados em scripts de treinamento.
Pontos Chave para o Exame D4
"detectar data drift" -- Data Quality Monitor + Data Capture + criar baseline "detectar degradação de desempenho do modelo" -- Model Quality Monitor + rótulos ground truth como pré-requisito "monitorar mudanças de viés" -- Clarify Bias Drift Monitor "monitorar mudanças em valores SHAP" -- Clarify Feature Attribution Drift Monitor "comparação segura de modelos sem impacto nos usuários" -- Shadow Testing "reduzir custos de treinamento em até 90%" -- Managed Spot Training "tráfego intermitente, sem custo de ociosidade" -- Serverless Inference "centenas de modelos pequenos compartilhando instância" -- Multi-model Endpoints "recomendar tipo de instância ideal automaticamente" -- Inference Recommender "bloquear acesso à internet no contêiner" -- enable_network_isolation=True "comunicação com serviços AWS sem internet" -- VPC endpoints (PrivateLink) "auditar chamadas de API do SageMaker" -- CloudTrail "rastrear relacionamentos modelo-dados-treinamento" -- ML Lineage Tracking