Por que MLOps importa
No desenvolvimento de software tradicional, CI/CD automatiza compilação, testes e implantação de mudanças de código. Em ML, é necessário versionar não apenas código, mas também dados e modelos, e a natureza não determinista do treinamento exige gates de validação mais complexos. MLOps é a abordagem sistemática para gerenciar essa complexidade: reprodutibilidade (recriar resultados de seis meses atrás), automação (acelerar ciclos de experimentação) e governança (registro auditável de quais modelos estão em produção e quem os aprovou).
SageMaker Pipelines
O SageMaker Pipelines é um serviço totalmente gerenciado para definir e executar fluxos de trabalho ML como grafos acíclicos dirigidos (DAG). Os principais tipos de etapa são: ProcessingStep (pré-processamento e feature engineering), TrainingStep (execução de jobs de treinamento), TuningStep (otimização de hiperparâmetros), TransformStep (Batch Transform), ModelStep (criação de recursos de modelo), ConditionStep (ramificação condicional, por exemplo, prosseguir apenas se a precisão superar um limiar) e CallbackStep (invocar serviços externos ou funções Lambda e aguardar sinal de conclusão).
Parâmetros de pipeline permitem injetar valores em tempo de execução, reutilizando a mesma definição em dev, staging e produção. O cache de etapas evita re-execução de etapas com entradas idênticas, reduzindo tempo e custo.
SageMaker Model Registry e Projects
O Model Registry é um catálogo de modelos treinados. Os modelos são registrados como versões dentro de grupos de modelos, com três estados de aprovação: PendingManualApproval, Approved e Rejected. O fluxo de aprovação combina validação automática (ConditionStep) com revisão humana opcional. Eventos de aprovação podem disparar pipelines de implantação automática via EventBridge.
O SageMaker Projects fornece templates com melhores práticas MLOps pré-configuradas. Ao criar um projeto, repositórios de build e deploy são gerados automaticamente, com CodePipeline conectando SageMaker Pipelines e o Model Registry.
Integração com CI/CD e estratégias de implantação
O CodePipeline orquestra o CI/CD geral conectando fontes (CodeCommit, GitHub, ECR), builds (CodeBuild: testes, build de contêineres, execução de pipelines SageMaker) e deploys (CloudFormation). As estratégias de atualização de endpoints incluem: blue/green (provisionar novo ambiente completo antes de trocar o tráfego), canary (enviar pequena porcentagem ao novo primeiro) e linear (aumentar tráfego gradualmente em intervalos fixos).
!3 estratégias de implantação do SageMaker
Step Functions, EventBridge e testes
O Step Functions é útil quando é necessário integrar serviços heterogêneos (Lambda, Glue, ECS, DynamoDB) com lógica de ramificação complexa. O EventBridge atua como hub para gatilhos baseados em eventos: retreinamento agendado, detecção de drift de dados, chegada de novos dados ao S3. Os gates de aprovação de modelos combinam validação automática com revisão humana (human-in-the-loop) para setores regulados.
Pontos-chave para o exame
"Definir fluxo ML como DAG, rastrear linhagem de artefatos" -- SageMaker Pipelines "Versionamento de modelos, status aprovado/rejeitado" -- Model Registry "Pending → Approved → deploy automático" -- Model Registry + EventBridge + CodePipeline "Etapa condicional, ramificar por limiar de métrica" -- ConditionStep "Fluxo com Lambda, Glue, ECS" -- Step Functions "Templates MLOps de início rápido" -- SageMaker Projects "Drift de dados → retreinamento automático" -- Model Monitor + EventBridge "Aprovação com revisão humana" -- Human-in-the-loop "5% do tráfego para nova versão primeiro" -- Estratégia canary