AIP-C01: Implantação de modelos e integração de APIs

Fundamentos do exame AIP-C01: saiba quando usar Bedrock API versus endpoints SageMaker, como implementar respostas em streaming, construir APIs GenAI com API Gateway e Lambda, e projetar arquiteturas orientadas a eventos.

Estratégia de Implantação: Bedrock vs SageMaker

 

A primeira decisão arquitetural ao integrar modelos de linguagem na AWS é escolher entre Amazon Bedrock e Amazon SageMaker.

| Critério | Amazon Bedrock | Amazon SageMaker | |---------|--------------|----------------| | Infraestrutura | Totalmente gerenciado | Escolha de instâncias | | Cobrança | Por token | Por tempo de instância | | Casos de uso | FMs pré-treinados, prototipagem rápida | Modelos personalizados, controle total |

Para o exame: se puder usar um FM pré-treinado sem personalização profunda → Bedrock. Se precisar de treinamento completo ou instâncias GPU específicas → SageMaker.

Tipos de Endpoints SageMaker

 

Inferência em tempo real: instâncias sempre ativas, latência mínima, ideal para produção 24/7 Inferência serverless: sem custo em inatividade, cold start de segundos, para tráfego esporádico Inferência assíncrona: payloads grandes (até 1 GB), processamento de 1-15 minutos, resultado no S3 Batch Transform: inferência em lote sobre datasets no S3, sem endpoint persistente

API do Bedrock: Converse vs InvokeModel

 

API fornece uma interface unificada para todos os modelos Bedrock (conversas multi-turno, prompts de sistema, tool use). usa o esquema nativo de cada modelo. Para novos projetos, usar facilita a troca de modelos sem alterações de código.

Streaming e Arquiteturas Assíncronas

 

O streaming de tokens em tempo real melhora significativamente a experiência do usuário. Bedrock suporta streaming via e . Para expor externamente, usar API Gateway HTTP API + Lambda (com ).

Para processamento assíncrono: S3 upload → SNS → SQS → Lambda (Bedrock) → resultado no S3. SQS atua como buffer para controlar a concorrência e gerenciar o throttling do Bedrock. Sempre configurar uma Dead Letter Queue para mensagens com falha.

!Pipeline de processamento GenAI orientado a eventos

Amazon Q Developer

 

Amazon Q Developer (antes CodeWhisperer) é o assistente de codificação com IA da AWS integrado em IDEs. Oferece autocompletar código, varredura de vulnerabilidades de segurança e geração de código a partir de linguagem natural. O plano Pro permite personalização sobre a base de código interna da organização.

Pontos Chave para o Exame

 

"API FM gerenciada, pagamento por token" -- Amazon Bedrock "Modelos personalizados, controle de instâncias" -- Amazon SageMaker "Sempre ativo, latência mínima" -- Endpoint de inferência em tempo real do SageMaker "Sem custo em inatividade" -- Inferência serverless do SageMaker "Processamento longo, payload grande" -- Inferência assíncrona do SageMaker "Interface unificada para todos os modelos" -- Converse API "Streaming de tokens em tempo real" -- InvokeModelWithResponseStream / ConverseStream "Fila para processamento GenAI assíncrono" -- SQS + Lambda + Bedrock "Erro de limite de throughput" -- ThrottlingException → backoff exponencial "Assistente de codificação com IA" -- Amazon Q Developer

Voltar à lista do blog