Operar aplicacoes GenAI em producao requer gerenciar tres dimensoes: custo, desempenho e qualidade. Este post cobre estrategias de otimizacao de custos, monitoramento com CloudWatch e metricas de avaliacao de modelos para AIP-C01.
Provisioned Throughput vs sob demanda
Provisioned Throughput oferece throughput garantido a taxa horaria fixa por Model Units. Ideal para trafego de producao previsivel e de alto volume. Sob demanda cobra por token consumido — melhor para cargas de trabalho irregulares ou desenvolvimento.
Estrategias de otimizacao de tokens: limitar , comprimir prompts do sistema, armazenar respostas em cache no ElastiCache/DynamoDB, usar Batch Inference para tarefas nao em tempo real (economia de ate 50%).
Chips especializados da AWS
AWS Trainium (trn1): otimizado para treinamento — reduz custos de treinamento em ate 50% AWS Inferentia (inf2): otimizado para inferencia — reduz custos de inferencia em ate 70%
Monitoramento com CloudWatch e X-Ray
Metricas-chave do Bedrock: , , /, erros 4xx e 5xx. O AWS X-Ray rastreia fluxos de solicitacao completos em Lambda → Bedrock → Knowledge Base → OpenSearch para identificar gargalos.
O SageMaker Model Monitor detecta quatro tipos de drift: qualidade de dados, qualidade do modelo, drift de vies e drift de atribuicao de caracteristicas.
Metricas de avaliacao de modelos
| Metrica | Metodo | Uso principal | |---------|--------|---------------| | ROUGE | Sobreposicao n-gram (recall) | Resumo de texto | | BLEU | Precisao n-gram | Traducao automatica | | BERTScore | Similaridade semantica (embeddings) | Qualidade geral de texto |
A avaliacao humana e os testes A/B com Production Variants do SageMaker complementam as metricas automaticas para capturar a experiencia real do usuario.
!Pipeline de testes de regressão e avaliação contínua
Resolucao de problemas operacionais
: backoff exponencial + considerar Provisioned Throughput : reduzir , usar respostas em streaming : arquitetura Multi-Region para alta disponibilidade