Training Job de SageMaker: la unidad básica del entrenamiento
Cada ejecución de entrenamiento en SageMaker funciona como un Training Job: una tarea de cómputo completamente gestionada. Cuando inicia un Training Job, SageMaker aprovisiona automáticamente la instancia especificada, ejecuta el contenedor de entrenamiento y termina la instancia al completarse el entrenamiento. Sin servidores persistentes, sin costos de cómputo inactivo entre ejecuciones.
Los parámetros clave en la configuración de un Training Job incluyen (imagen de contenedor a usar), (ubicación S3, nombres de canales y modo de entrada), (tipo y cantidad de instancias), (ruta S3 para artefactos del modelo) e .
Modos de entrada de entrenamiento
El modo File copia todo el dataset de S3 al disco local de la instancia antes de comenzar. Simple, pero lento para datasets grandes. Pipe Mode transmite datos directamente desde S3 sin escritura en disco: inicio casi inmediato, sin límites de almacenamiento, pero solo acceso secuencial. FastFile Mode combina ambas ventajas: interfaz de sistema de archivos con streaming bajo demanda desde S3, acceso aleatorio compatible y sin espera de descarga completa. Es el modo recomendado para datasets grandes en flujos de trabajo modernos de SageMaker.
Entrenamiento distribuido y Spot Training
El paralelismo de datos distribuye el dataset entre múltiples GPU, cada una con una copia completa del modelo, sincronizando gradientes mediante AllReduce. La biblioteca de Datos Paralelos de SageMaker optimiza esta comunicación. El paralelismo de modelos es necesario cuando el modelo supera la memoria de una GPU, particionando las capas entre múltiples GPU. La biblioteca Model Parallel de SageMaker soporta paralelismo de pipeline y de tensores.
Managed Spot Training utiliza instancias Spot de EC2, que cuestan hasta un 90% menos que On-Demand. SageMaker gestiona las interrupciones automáticamente y reanuda desde el último checkpoint cuando la instancia vuelve a estar disponible. El checkpointing en es el mecanismo habilitador. Warm Pools mantienen instancias en estado cálido entre trabajos, eliminando la latencia de aprovisionamiento durante ciclos de experimentación activos.
!Paralelismo de datos vs paralelismo de modelo
Ajuste de hiperparámetros y evaluación de modelos
SageMaker Automatic Model Tuning (AMT) automatiza la búsqueda de hiperparámetros. La búsqueda aleatoria es simple y totalmente paralelizable. La búsqueda en cuadrícula garantiza cobertura completa pero es combinatoriamente explosiva. La optimización bayesiana es la más eficiente en muestras: construye un modelo probabilístico y selecciona la siguiente configuración según la mejora esperada. Es el valor predeterminado de AMT.
SageMaker Experiments rastrea ejecuciones de ML: hiperparámetros, métricas y artefactos. SageMaker Debugger captura valores de tensores y métricas del sistema durante el entrenamiento, con reglas integradas que detectan gradientes que desaparecen, sobreajuste y cuellos de botella de GPU. SageMaker Clarify detecta sesgos previos y posteriores al entrenamiento y proporciona valores SHAP para la explicabilidad del modelo.
Las métricas clave de clasificación incluyen Precisión (optimizar cuando los FP son costosos), Recall (optimizar cuando los FN son costosos), F1 Score (media armónica para desequilibrio de clases) y AUC-ROC (rendimiento independiente del umbral). Para regresión: RMSE (sensible a errores grandes) y MAE (robusto a valores atípicos).
Consejos para el examen
"Dataset grande, minimizar tiempo de inicio" -- FastFile Mode o Pipe Mode "Reducir costos de entrenamiento, interrupciones aceptables" -- Managed Spot Training + checkpointing "Experimentación iterativa, minimizar espera entre ejecuciones" -- SageMaker Warm Pools "Modelo demasiado grande para una sola GPU" -- SageMaker Model Parallel Library "Optimización automatizada de hiperparámetros, más eficiente" -- Optimización Bayesiana (predeterminado en AMT) "Diagnosticar gradientes que desaparecen, cuellos de botella de GPU" -- SageMaker Debugger + Profiler "Rastrear hiperparámetros de experimentos, comparar resultados" -- SageMaker Experiments "Detección de sesgos + explicabilidad SHAP" -- SageMaker Clarify "Desequilibrio de clases, métrica única" -- F1 Score o AUC-ROC "Alto costo de falsos positivos" -- Optimizar Precisión "Alto costo de falsos negativos (diagnóstico médico)" -- Optimizar Recall