AIP-C01: Selección de modelos FM y diseño de soluciones

Fundamentos del examen AIP-C01: compare las opciones del catalogo de modelos de Amazon Bedrock, ajuste los parametros de inferencia y entienda los compromisos entre Provisioned Throughput e inferencia bajo demanda.

El examen AIP-C01 evalua la capacidad de mapear requisitos de negocio a caracteristicas de modelos FM, no solo memorizar nombres. Esta guia cubre el catalogo de modelos de Amazon Bedrock, ajuste de parametros de inferencia y criterios de seleccion de Provisioned Throughput.

 

Analisis de requisitos

Antes de seleccionar un modelo, analice tres ejes: modalidad de entrada/salida, el triangulo de compromiso costo-latencia-calidad, y el tamano de la ventana de contexto. La modalidad determina la viabilidad; el triangulo de compromiso define que restriccion domina; la ventana de contexto es decisiva para documentos largos.

!El equilibrio Costo-Latencia-Calidad

Catalogo de modelos Amazon Bedrock

Amazon Bedrock es un servicio totalmente administrado que proporciona acceso a FMs de multiples proveedores a traves de una sola API.

Claude (Anthropic): Haiku (baja latencia), Sonnet (equilibrio), Opus (maxima calidad), todos con 200K tokens de contexto Titan (AWS): Text para generacion, Embeddings V2 para RAG, Image Generator para imagenes Llama (Meta): Open-source, ideal para fine-tuning de dominio especifico Mixtral (Mistral): Arquitectura MoE, calidad de 70B a costo reducido Cohere: Command para flujos multilingues, Embed para busqueda semantica

 

Parametros de inferencia clave

| Parametro | Rango util | Uso | |-----------|-----------|-----| | temperature | 0.0–1.0 | Controla la diversidad/creatividad | | top-p | 0.1–1.0 | Muestreo por masa de probabilidad acumulada | | top-k | 1–500 | Restringe el conjunto de tokens candidatos | | max_tokens | segun caso | Control directo de costo | | stop_sequences | strings | Detiene la generacion al encontrarlos |

 

Provisioned Throughput vs Bajo Demanda

El modo bajo demanda cobra por token sin reserva, adecuado para trafico impredecible. Provisioned Throughput reserva unidades de modelo (MU) con tarifa por hora, garantizando el rendimiento — esencial para produccion con SLA y obligatorio para modelos fine-tuned. Los compromisos de 6 meses son aproximadamente un 40% mas baratos.

 

Inference Profile multirregion

Agrupa endpoints de modelos en multiples regiones AWS detras de un unico endpoint. Permite distribucion de trafico por capacidad, optimizacion geografica y failover automatico en caso de fallo regional.

Volver a la lista del blog