Estrategia de Despliegue: Bedrock vs SageMaker
La primera decisión arquitectónica al integrar modelos de lenguaje en AWS es elegir entre Amazon Bedrock y Amazon SageMaker.
| Criterio | Amazon Bedrock | Amazon SageMaker | |----------|--------------|----------------| | Infraestructura | Totalmente gestionado | Elección de instancias | | Facturación | Por token | Por tiempo de instancia | | Casos de uso | FMs preentrenados, prototipado rápido | Modelos personalizados, control total |
Para el examen: si se puede usar un FM preentrenado sin personalización profunda → Bedrock. Si se necesita entrenamiento completo o instancias GPU específicas → SageMaker.
Tipos de Endpoints de SageMaker
Inferencia en tiempo real: instancias siempre activas, latencia mínima, ideal para producción 24/7 Inferencia serverless: sin costo en inactividad, arranque en frío de segundos, para tráfico esporádico Inferencia asíncrona: payloads grandes (hasta 1 GB), procesamiento de 1-15 minutos, resultado en S3 Batch Transform: inferencia por lotes sobre datasets en S3, sin endpoint persistente
API de Bedrock: Converse vs InvokeModel
API proporciona una interfaz unificada para todos los modelos de Bedrock (conversaciones multi-turno, prompts de sistema, tool use). usa el esquema nativo de cada modelo. Para nuevos proyectos, usar facilita el intercambio de modelos sin cambios de código.
Streaming y Arquitecturas Asíncronas
El streaming de tokens en tiempo real mejora notablemente la experiencia de usuario. Bedrock soporta streaming mediante y . Para exponer esto externamente, usar API Gateway HTTP API + Lambda (con ).
Para procesamiento asíncrono: S3 upload → SNS → SQS → Lambda (Bedrock) → resultado en S3. SQS actúa como buffer para controlar la concurrencia y gestionar el throttling de Bedrock. Configurar siempre una Dead Letter Queue para mensajes fallidos.
!Pipeline de procesamiento GenAI basado en eventos
Amazon Q Developer
Amazon Q Developer (antes CodeWhisperer) es el asistente de codificación con IA de AWS integrado en IDEs. Ofrece autocompletado de código, escaneo de vulnerabilidades de seguridad y generación de código a partir de lenguaje natural. El plan Pro permite personalización sobre la base de código interna de la organización.
Puntos Clave para el Examen
"API FM gestionada, pago por token" -- Amazon Bedrock "Modelos personalizados, control de instancias" -- Amazon SageMaker "Siempre activo, latencia mínima" -- Endpoint de inferencia en tiempo real de SageMaker "Sin costo en inactividad" -- Inferencia serverless de SageMaker "Procesamiento largo, payload grande" -- Inferencia asíncrona de SageMaker "Interfaz unificada para todos los modelos" -- Converse API "Streaming de tokens en tiempo real" -- InvokeModelWithResponseStream / ConverseStream "Cola para procesamiento GenAI asíncrono" -- SQS + Lambda + Bedrock "Error de límite de throughput" -- ThrottlingException → backoff exponencial "Asistente de codificación con IA" -- Amazon Q Developer