AIP-C01: Despliegue de modelos e integración de APIs

Fundamentos del examen AIP-C01: aprenda cuando usar Bedrock API versus SageMaker endpoints, como implementar respuestas en streaming, construir APIs GenAI con API Gateway y Lambda, y disenar arquitecturas basadas en eventos.

Estrategia de Despliegue: Bedrock vs SageMaker

 

La primera decisión arquitectónica al integrar modelos de lenguaje en AWS es elegir entre Amazon Bedrock y Amazon SageMaker.

| Criterio | Amazon Bedrock | Amazon SageMaker | |----------|--------------|----------------| | Infraestructura | Totalmente gestionado | Elección de instancias | | Facturación | Por token | Por tiempo de instancia | | Casos de uso | FMs preentrenados, prototipado rápido | Modelos personalizados, control total |

Para el examen: si se puede usar un FM preentrenado sin personalización profunda → Bedrock. Si se necesita entrenamiento completo o instancias GPU específicas → SageMaker.

Tipos de Endpoints de SageMaker

 

Inferencia en tiempo real: instancias siempre activas, latencia mínima, ideal para producción 24/7 Inferencia serverless: sin costo en inactividad, arranque en frío de segundos, para tráfico esporádico Inferencia asíncrona: payloads grandes (hasta 1 GB), procesamiento de 1-15 minutos, resultado en S3 Batch Transform: inferencia por lotes sobre datasets en S3, sin endpoint persistente

API de Bedrock: Converse vs InvokeModel

 

API proporciona una interfaz unificada para todos los modelos de Bedrock (conversaciones multi-turno, prompts de sistema, tool use). usa el esquema nativo de cada modelo. Para nuevos proyectos, usar facilita el intercambio de modelos sin cambios de código.

Streaming y Arquitecturas Asíncronas

 

El streaming de tokens en tiempo real mejora notablemente la experiencia de usuario. Bedrock soporta streaming mediante y . Para exponer esto externamente, usar API Gateway HTTP API + Lambda (con ).

Para procesamiento asíncrono: S3 upload → SNS → SQS → Lambda (Bedrock) → resultado en S3. SQS actúa como buffer para controlar la concurrencia y gestionar el throttling de Bedrock. Configurar siempre una Dead Letter Queue para mensajes fallidos.

!Pipeline de procesamiento GenAI basado en eventos

Amazon Q Developer

 

Amazon Q Developer (antes CodeWhisperer) es el asistente de codificación con IA de AWS integrado en IDEs. Ofrece autocompletado de código, escaneo de vulnerabilidades de seguridad y generación de código a partir de lenguaje natural. El plan Pro permite personalización sobre la base de código interna de la organización.

Puntos Clave para el Examen

 

"API FM gestionada, pago por token" -- Amazon Bedrock "Modelos personalizados, control de instancias" -- Amazon SageMaker "Siempre activo, latencia mínima" -- Endpoint de inferencia en tiempo real de SageMaker "Sin costo en inactividad" -- Inferencia serverless de SageMaker "Procesamiento largo, payload grande" -- Inferencia asíncrona de SageMaker "Interfaz unificada para todos los modelos" -- Converse API "Streaming de tokens en tiempo real" -- InvokeModelWithResponseStream / ConverseStream "Cola para procesamiento GenAI asíncrono" -- SQS + Lambda + Bedrock "Error de límite de throughput" -- ThrottlingException → backoff exponencial "Asistente de codificación con IA" -- Amazon Q Developer

Volver a la lista del blog