Selección de modelos: criterio práctico sobre el terreno
Uno de los mayores cambios de mentalidad al crecer como ingeniero de ML es entender que saber cuándo usar cada enfoque es mucho más valioso que conocer los últimos algoritmos. Puedes implementar un transformador desde cero en PyTorch, pero si no puedes decidir si XGBoost supera a un modelo de fundación para un problema de clasificación tabular dado, desperdiciarás presupuesto y tiempo en cada proyecto.
El examen AWS MLA-C01 Dominio 2, Tarea 2.1 evalúa exactamente este criterio: cómo mapear tipos de problemas, características de datos y restricciones operativas al enfoque de modelado correcto en AWS.
Algoritmos integrados de SageMaker
Los algoritmos integrados de SageMaker son implementaciones optimizadas por AWS que eliminan la necesidad de escribir código de entrenamiento desde cero. Se especifica un URI de imagen de algoritmo, se configuran los hiperparámetros y se lanza el trabajo de entrenamiento.
Para aprendizaje supervisado sobre datos tabulares, XGBoost es el primer candidato. Maneja valores faltantes de forma nativa, admite datos dispersos y genera importancia de características. Linear Learner es más rápido e interpretable, ideal cuando se necesita explicar coeficientes a stakeholders regulados.
Los algoritmos de visión por computadora incluyen Clasificación de Imágenes (basado en ResNet, soporta fine-tuning), Detección de Objetos (predicción de bounding boxes) y Segmentación Semántica (identificación a nivel de píxel). Para NLP, BlazingText admite Word2Vec y clasificación de texto supervisada. Random Cut Forest es el algoritmo de detección de anomalías sin etiquetas. DeepAR maneja múltiples series temporales simultáneamente con arquitectura RNN.
!Algoritmos integrados vs BYOC
JumpStart, Bedrock y la elección del modelo de despliegue
SageMaker JumpStart ejecuta los pesos del modelo en tu propia cuenta AWS con endpoints de SageMaker, dando control completo sobre la infraestructura y capacidad de fine-tuning personalizado. Amazon Bedrock es completamente sin servidor: accedes a los modelos (Claude, Titan, Llama, Stable Diffusion) mediante llamadas API sin gestionar ninguna infraestructura.
La pregunta de examen típica sobre Bedrock es: "El equipo quiere añadir capacidades de IA generativa con la mínima gestión de infraestructura — ¿qué servicio deben usar?" La respuesta es Bedrock. Si requieren fine-tuning con datos propios y control de infraestructura, JumpStart o SageMaker Script Mode con HuggingFace Estimator son la respuesta.
SageMaker Autopilot automatiza la selección de algoritmos, preprocesamiento y ajuste de hiperparámetros, generando notebooks con el código del pipeline para máxima transparencia. Es ideal para líneas base rápidas o equipos con poca experiencia en ML.
Servicios de IA gestionados y compensación interpretabilidad-precisión
No todos los problemas de ML requieren SageMaker. Los servicios de IA gestionados de AWS (Rekognition, Comprehend, Translate, Transcribe, Textract, Forecast, Personalize) ofrecen capacidades de ML mediante llamadas API sin entrenamiento de modelos. Son la elección correcta cuando las capacidades estándar satisfacen los requisitos y la velocidad de lanzamiento es prioritaria.
El equilibrio entre interpretabilidad y precisión determina la selección del modelo en entornos regulados. Los modelos lineales y XGBoost son más interpretables; SageMaker Clarify con SHAP refuerza esto. Los modelos de deep learning dominan en datos no estructurados pero son cajas negras. Saber cuándo los requisitos de interpretabilidad deben superar a la precisión bruta es una habilidad de criterio clave que evalúa el MLA-C01.
Consejos para el examen
"Datos tabulares, clasificación o regresión" -- XGBoost o Linear Learner primero "Detección de anomalías, sin etiquetas" -- Random Cut Forest (RCF) "Pronóstico de series temporales, múltiples series" -- DeepAR o Amazon Forecast "IA generativa, sin gestión de infraestructura" -- Amazon Bedrock "Fine-tuning de LLM con datos propios, infraestructura propia" -- SageMaker JumpStart "Línea base rápida, equipo con poca experiencia en ML" -- SageMaker Autopilot "Capacidad estándar: traducción, voz, análisis de imágenes" -- Servicios de IA gestionados de Amazon "Modelo de Hugging Face" -- SageMaker HuggingFace Estimator "Requisito regulatorio de explicar decisiones" -- Linear Learner + Clarify SHAP