Estratégia de Implantação: Bedrock vs SageMaker
A primeira decisão arquitetural ao integrar modelos de linguagem na AWS é escolher entre Amazon Bedrock e Amazon SageMaker.
| Critério | Amazon Bedrock | Amazon SageMaker | |---------|--------------|----------------| | Infraestrutura | Totalmente gerenciado | Escolha de instâncias | | Cobrança | Por token | Por tempo de instância | | Casos de uso | FMs pré-treinados, prototipagem rápida | Modelos personalizados, controle total |
Para o exame: se puder usar um FM pré-treinado sem personalização profunda → Bedrock. Se precisar de treinamento completo ou instâncias GPU específicas → SageMaker.
Tipos de Endpoints SageMaker
Inferência em tempo real: instâncias sempre ativas, latência mínima, ideal para produção 24/7 Inferência serverless: sem custo em inatividade, cold start de segundos, para tráfego esporádico Inferência assíncrona: payloads grandes (até 1 GB), processamento de 1-15 minutos, resultado no S3 Batch Transform: inferência em lote sobre datasets no S3, sem endpoint persistente
API do Bedrock: Converse vs InvokeModel
API fornece uma interface unificada para todos os modelos Bedrock (conversas multi-turno, prompts de sistema, tool use). usa o esquema nativo de cada modelo. Para novos projetos, usar facilita a troca de modelos sem alterações de código.
Streaming e Arquiteturas Assíncronas
O streaming de tokens em tempo real melhora significativamente a experiência do usuário. Bedrock suporta streaming via e . Para expor externamente, usar API Gateway HTTP API + Lambda (com ).
Para processamento assíncrono: S3 upload → SNS → SQS → Lambda (Bedrock) → resultado no S3. SQS atua como buffer para controlar a concorrência e gerenciar o throttling do Bedrock. Sempre configurar uma Dead Letter Queue para mensagens com falha.
!Pipeline de processamento GenAI orientado a eventos
Amazon Q Developer
Amazon Q Developer (antes CodeWhisperer) é o assistente de codificação com IA da AWS integrado em IDEs. Oferece autocompletar código, varredura de vulnerabilidades de segurança e geração de código a partir de linguagem natural. O plano Pro permite personalização sobre a base de código interna da organização.
Pontos Chave para o Exame
"API FM gerenciada, pagamento por token" -- Amazon Bedrock "Modelos personalizados, controle de instâncias" -- Amazon SageMaker "Sempre ativo, latência mínima" -- Endpoint de inferência em tempo real do SageMaker "Sem custo em inatividade" -- Inferência serverless do SageMaker "Processamento longo, payload grande" -- Inferência assíncrona do SageMaker "Interface unificada para todos os modelos" -- Converse API "Streaming de tokens em tempo real" -- InvokeModelWithResponseStream / ConverseStream "Fila para processamento GenAI assíncrono" -- SQS + Lambda + Bedrock "Erro de limite de throughput" -- ThrottlingException → backoff exponencial "Assistente de codificação com IA" -- Amazon Q Developer