Infraestructura de despliegue y estrategias de escalado

Desplegar un modelo entrenado en producción es uno de los pasos más complejos del pipeline de ML. Esta guía cubre los cuatro modos de inferencia de SageMaker (tiempo real, batch, serverless, async), cómo elegir entre ellos y cómo aplicar estrategias de Auto Scaling y selección de instancias.

La decisión de despliegue: qué infraestructura elegir

Desplegar un modelo entrenado de forma fiable en producción suele ser más complejo que entrenarlo. SageMaker ofrece cuatro modos de inferencia distintos. Los tres criterios clave son: tolerancia a la latencia, tamaño del payload y patrón de tráfico.

 

Endpoints en tiempo real

Los endpoints en tiempo real de SageMaker son la opción correcta cuando una aplicación necesita predicciones en cientos de milisegundos. Los casos típicos incluyen motores de recomendación, detección de fraude y análisis de imágenes en tiempo real. Para la selección de instancias, los modelos de deep learning requieren GPU (ml.g4dn, ml.g5, ml.p3), mientras que los modelos tradicionales funcionan bien en CPU (ml.c5, ml.m5). Las instancias basadas en AWS Inferentia (ml.inf1, ml.inf2) pueden ofrecer hasta un 70% de ahorro frente a GPU con alta capacidad. Las variantes de producción permiten dividir el tráfico entre versiones de modelo para A/B testing.

 

Batch Transform

Batch Transform es ideal para procesar grandes volúmenes de datos almacenados en S3 cuando no se necesita respuesta en tiempo real: puntuación por lotes nocturna, preprocesamiento en pipelines de datos, generación offline de recomendaciones. Las instancias se terminan automáticamente al finalizar el trabajo.

 

Inferencia serverless e inferencia asíncrona

La inferencia serverless está diseñada para tráfico intermitente o impredecible. Se paga solo por el tiempo de cómputo usado, pero hay un tiempo de arranque en frío cuando el contenedor ha estado inactivo. La inferencia asíncrona es la elección correcta para payloads grandes (hasta 1GB) o tiempos de procesamiento prolongados. Las solicitudes se colocan en una cola y los resultados se guardan en S3.

 

Tabla comparativa

| Modo | Latencia | Payload máx. | Modelo de costo | Caso de uso | |------|---------|--------------|-----------------|-------------| | Endpoint tiempo real | Milisegundos | 6MB | Tiempo de instancia | Recomendaciones en tiempo real | | Batch Transform | N/A | Ilimitado | Duración del trabajo | Puntuación offline masiva | | Serverless | Decenas-cientos de ms | 4MB | Invocaciones + duración | Tráfico intermitente | | Async | Segundos-minutos | 1GB | Tiempo de instancia | Procesamiento de archivos grandes |

!Los 4 modos de inferencia de SageMaker

MME, Neo, Inferentia y Auto Scaling

Los endpoints multi-modelo (MME) sirven miles de modelos similares desde un solo endpoint, cargándolos dinámicamente desde S3. SageMaker Neo compila modelos para hardware específico (EC2, dispositivos edge, Inferentia). Las instancias Inf1/Inf2 ofrecen mayor eficiencia de costo para inferencia. Auto Scaling admite seguimiento de destino, escalado por pasos y escalado programado, con métricas como InvocationsPerInstance.

 

Contenedores y VPC

SageMaker ofrece contenedores precompilados para los principales frameworks. Para necesidades especiales, BYOC (trae tu propio contenedor) con ECR. En producción, los endpoints suelen desplegarse dentro de una VPC. Para dispositivos edge, se combina SageMaker Neo con IoT Greengrass y SageMaker Edge Manager.

 

Puntos clave para el examen

"Latencia de milisegundos, tráfico continuo" -- Endpoint en tiempo real "Procesar gran dataset en lote, resultados en S3" -- Batch Transform "Tráfico intermitente, minimizar costo" -- Inferencia serverless "Payload de 1GB, procesamiento largo" -- Inferencia asíncrona "Miles de modelos, poco tráfico individual" -- MME "Reducir costo de inferencia GPU" -- AWS Inferentia "Compilar para dispositivo edge" -- SageMaker Neo + IoT Greengrass

Volver a la lista del blog