Guía Completa del Examen AWS MLA-C01
AWS Certified Machine Learning Engineer - Associate (MLA-C01) es una certificación lanzada en 2024 que se diferencia claramente de su predecesora MLS-C01. Mientras MLS-C01 estaba orientada a científicos de datos e investigadores, MLA-C01 está diseñada para ingenieros que construyen y operan sistemas de ML en producción. El examen no termina en el entrenamiento del modelo: evalúa cómo desplegar, monitorizar, asegurar y optimizar costos en todo el ciclo de vida del ML en AWS.
Si has construido pipelines de ML en producción, reconocerás los problemas que evalúa el examen. Los cuatro dominios reflejan casi directamente las fases de un proyecto de ML real, con SageMaker como hilo conductor de todos ellos.
Especificaciones del Examen
| Elemento | Detalles | |----------|---------| | Código del examen | MLA-C01 | | Total de preguntas | 65 (50 puntuadas + 15 no puntuadas) | | Duración | 170 minutos | | Puntuación mínima | 720 de 1000 | | Costo | $150 USD | | Tipos de preguntas | Respuesta única y respuesta múltiple | | Vigencia | 3 años | | Experiencia recomendada | 1+ año de experiencia práctica en ingeniería de ML |
Con 170 minutos para 65 preguntas, dispones de aproximadamente 2 minutos y 37 segundos por pregunta. Las 15 preguntas no puntuadas no están identificadas, así que trata cada pregunta con la misma atención. Las preguntas de respuesta múltiple requieren lectura cuidadosa.
Distribución de los Cuatro Dominios
| Dominio | Nombre | Peso | |---------|--------|------| | D1 | Preparación de datos para ML | 28% | | D2 | Desarrollo de modelos de ML | 26% | | D3 | Despliegue y orquestación de flujos de ML | 22% | | D4 | Monitorización, mantenimiento y seguridad de soluciones ML | 24% |
D1 tiene el mayor peso, lo que refleja la realidad del trabajo diario: la preparación de datos y la ingeniería de características consumen entre el 60% y el 80% del esfuerzo en proyectos reales de ML. D4, con un 24%, muestra que la operación responsable de modelos en producción es tan importante como construirlos.
!Ponderación de dominios del examen MLA-C01
Detalle de cada Dominio
D1: Preparación de Datos para ML (28%)
Cubre la entrada del pipeline de ML. Los tres subtemas son ingesta y almacenamiento de datos, transformación y feature engineering, y calidad y gobernanza de datos.
Para ingesta y almacenamiento se trabaja con S3, Kinesis Data Streams, Kinesis Firehose, Glue Data Catalog y Lake Formation. Para transformación, SageMaker Data Wrangler, SageMaker Processing, Glue ETL y SageMaker Feature Store son las herramientas centrales. Para calidad y gobernanza, el foco está en detectar data drift, identificar sesgos en datasets y rastrear el linaje de datos.
D2: Desarrollo de Modelos de ML (26%)
Este dominio se centra en usar las capacidades de entrenamiento de SageMaker de forma efectiva, más que en teoría de algoritmos. SageMaker JumpStart y Autopilot representan diferentes puntos de entrada: JumpStart provee modelos pre-entrenados para fine-tuning, mientras Autopilot automatiza la selección y entrenamiento desde datos crudos. SageMaker Clarify gestiona detección de sesgos y explicabilidad, mientras Debugger inspecciona tensores durante el entrenamiento.
D3: Despliegue y Orquestación (22%)
Los cuatro modos de inferencia son tema frecuente en el examen: Real-time Endpoints para inferencia síncrona de baja latencia, Batch Transform para datasets offline grandes, Serverless Inference para cargas de trabajo infrecuentes y Async Inference para payloads grandes con respuesta asíncrona. SageMaker Model Registry gestiona versiones y flujos de aprobación entre desarrollo y despliegue.
D4: Monitorización, Mantenimiento y Seguridad (24%)
SageMaker Model Monitor detecta data drift y model drift en tiempo real. Los temas de seguridad incluyen roles IAM con mínimo privilegio, cifrado KMS, aislamiento en VPC y PrivateLink. La optimización de costos incluye Managed Spot Training para hasta un 90% de ahorro en trabajos de entrenamiento.
El Ecosistema SageMaker
El cambio de perspectiva más importante para MLA-C01 es entender que SageMaker no es un servicio único, sino una plataforma con docenas de componentes que cubren cada etapa del ciclo de vida del ML. Una vez que tienes el mapa de SageMaker en la cabeza, los cuatro dominios empiezan a sentirse como cuatro vistas del mismo flujo de trabajo.
| Componente SageMaker | Dominio | Rol Principal | |---------------------|---------|--------------| | Data Wrangler | D1 | Transformación de datos sin código | | Feature Store | D1 | Almacén de características online y offline | | Processing | D1, D2 | Jobs de preprocesamiento a gran escala | | JumpStart | D2 | Modelos pre-entrenados y plantillas de soluciones ML | | Autopilot | D2 | Generación automática de pipelines AutoML | | Clarify | D2, D4 | Detección de sesgos y explicabilidad | | Model Registry | D3 | Versionado y aprobación de modelos | | Pipelines | D3 | Orquestación de flujos de trabajo ML | | Model Monitor | D4 | Monitorización de calidad del modelo en producción |
Consejos para el Examen
"Data drift vs model drift" -- El data drift es un cambio en la distribución de las características de entrada. El model drift es una degradación en la calidad de predicción para entradas similares. SageMaker Model Monitor detecta ambos. "Elección del modo de inferencia" -- Real-time para baja latencia, Async para payloads grandes, Serverless para tráfico esporádico, Batch Transform para datasets offline. El patrón de tráfico del escenario guía la respuesta. "Feature Store: online vs offline" -- El almacén online sirve lecturas de latencia en milisegundos para inferencia en tiempo real. El almacén offline respalda el entrenamiento en batch. La mayoría de los sistemas en producción usan ambos simultáneamente. "Managed Spot Training" -- Hasta un 90% de reducción de costos. Requiere checkpointing en S3 para que los trabajos interrumpidos puedan reanudarse. "SageMaker Pipelines vs Step Functions" -- Pipelines es nativo de ML con pasos de primera clase para SageMaker. Step Functions es más amplio y preferido cuando se mezclan servicios como Lambda, ECS y otros en un mismo flujo. "SageMaker Neo" -- Compilación y optimización de modelos para hardware específico, incluyendo dispositivos edge. Aparece en escenarios de IoT e inferencia en el borde.
Reflexión Final
MLA-C01 es una certificación práctica que recompensa a los ingenieros que han trabajado en pipelines de ML reales. El enfoque de estudio más efectivo es trazar un proyecto de ML completo desde los datos crudos hasta el despliegue en producción con monitorización activa, identificando qué servicio AWS gestiona cada paso y por qué. Cuando puedas recorrer ese flujo con confianza, las preguntas basadas en escenarios del examen se vuelven mucho más abordables.
---
Serie de Profundización por Dominio y Próximos Pasos
Con el panorama completo de esta guía, continúa con las publicaciones de profundización a continuación para desarrollar el criterio a nivel de servicio en cada dominio.
| | Tema | |---|------| | 2 | Ingesta y Almacenamiento de Datos | | 3 | Ingeniería de Características y Calidad de Datos | | 4 | Elección del Enfoque de Modelado | | 5 | Entrenamiento, Ajuste y Evaluación de Modelos | | 6 | Infraestructura de despliegue y estrategias de escalado | | 7 | Construcción de pipelines MLOps y CI/CD | | 8 | Monitoreo de Modelos, Optimización de Costos y Seguridad |
¿Listo para saber en qué punto estás? Prueba ahora el examen de práctica de MLA-C01.