Ingeniería de Características y Calidad de Datos

Se dice que la ingeniería de características representa el 80% del ML, y no es una exageración. Transformar datos crudos en representaciones significativas para el modelo es donde ocurre la mayor parte del trabajo real. AWS proporciona una cadena de herramientas completa: SageMaker Data Wrangler para transformación visual, Processing para preprocesamiento personalizado a gran escala, y Feature Store para servir características de manera consistente.

Por Qué la Ingeniería de Características Es la Habilidad Más Impactante en ML

 

Pregunta a cualquier practicante de ML experimentado qué diferencia un modelo mediocre de uno excelente, y la respuesta casi siempre vuelve a las características. Los datos crudos rara vez tienen la forma correcta para que un modelo aprenda directamente. La fecha de creación de una cuenta es menos útil que los días transcurridos desde la creación. Una columna de salario con una larga cola derecha se beneficia de una transformación logarítmica. Las variables categóricas necesitan codificación antes de que la mayoría de los algoritmos puedan procesarlas.

AWS proporciona una cadena de herramientas completa que cubre desde la transformación visual de datos hasta la gestión de características de nivel productivo.

 

SageMaker Data Wrangler — Transformación Visual de Datos

 

SageMaker Data Wrangler es un entorno interactivo con GUI construido dentro de SageMaker Studio para explorar y transformar datos sin escribir código extenso. Se conecta a S3, Athena, Redshift, EMR y Feature Store, entre otros.

La biblioteca de transformaciones incluye más de 300 transformaciones integradas: imputación de valores faltantes, manejo de valores atípicos, codificación (one-hot, ordinal, codificación por objetivo), escalado (normalización Min-Max, estandarización Z-score), extracción de características de fecha/hora, y transformaciones personalizadas mediante Python o PySpark en línea.

La función Quick Model permite entrenar un modelo ligero antes y después de una transformación para ver inmediatamente si la ingeniería de características mejora el rendimiento del modelo. Los flujos completados de Data Wrangler se pueden exportar directamente a SageMaker Processing Jobs, Pipelines o canalizaciones de ingesta de Feature Store.

 

SageMaker Processing — Preprocesamiento Personalizado a Gran Escala

 

Cuando necesitas control programático completo sobre el preprocesamiento, SageMaker Processing es la herramienta correcta. Los trabajos de Processing ejecutan scripts de Python, PySpark o R en contenedores administrados en cómputo aprovisionado automáticamente. Todas las entradas y salidas están versionadas, haciendo que el paso de preprocesamiento sea completamente reproducible.

SKLearnProcessor ejecuta scripts basados en scikit-learn. PySparkProcessor ejecuta Spark distribuido para preparación de datos a gran escala. ScriptProcessor acepta cualquier imagen Docker personalizada.

 

Técnicas Fundamentales de Ingeniería de Características

 

La codificación one-hot convierte variables categóricas en columnas de indicadores binarios. La consideración clave es la cardinalidad — para categorías con muchos valores únicos, la codificación por objetivo o los embeddings son mejores opciones.

La codificación de etiquetas asigna valores enteros a categorías y funciona bien para variables ordinales y algoritmos basados en árboles.

El binning convierte características continuas en intervalos discretos, reduciendo el impacto de valores atípicos y mejorando la interpretabilidad.

La transformación logarítmica aborda las distribuciones asimétricas comunes en datos financieros y de conteo. Usar log(x+1) maneja los valores cero.

La normalización Min-Max escala todas las características a [0, 1] o [-1, 1]. Esencial para algoritmos basados en distancias y aprendizaje por gradiente.

La estandarización Z-score (media=0, std=1) es más adecuada para algoritmos que asumen normalidad como regresión lineal y PCA.

 

SageMaker Feature Store — El Hub Central de Características

 

En sistemas ML productivos, una de las causas más comunes de degradación silenciosa del modelo es el sesgo entrenamiento-servicio: las características usadas durante el entrenamiento se calculan de manera diferente a las servidas en inferencia. Feature Store resuelve esto proporcionando una única fuente de verdad.

El Online Store es un almacén clave-valor de baja latencia (lecturas en milisegundos) respaldado por Amazon ElastiCache, diseñado para recuperación de características en tiempo real durante la inferencia.

El Offline Store está respaldado por S3 y almacena el historial completo de todos los valores de características con marcas de tiempo de evento. Esto soporta la generación de datos de entrenamiento por lotes y consultas de viaje en el tiempo.

Los Feature Groups son contenedores lógicos para características relacionadas. Al construir conjuntos de datos de entrenamiento, la unión punto en el tiempo del Offline Store garantiza que las características reflejen solo información disponible en el momento de la predicción, evitando la fuga de datos.

 

Calidad de Datos y Detección de Sesgo

 

AWS Glue Data Quality permite definir reglas usando DQDL y evaluarlas automáticamente contra un conjunto de datos: reglas de completitud, precisión, unicidad e integridad referencial.

Amazon Glue DataBrew es una herramienta visual de perfilado de datos. Conecta un conjunto de datos y genera automáticamente estadísticas de columnas, gráficos de distribución y mapas de calor de valores faltantes.

SageMaker Clarify cuantifica el sesgo antes del entrenamiento del modelo. Las métricas clave incluyen CI (desequilibrio de clases), DPL (diferencia en proporciones de etiquetas positivas) y Divergencia KL.

 

Gobierno de Datos y Etiquetado

 

Amazon Macie usa machine learning para descubrir y clasificar automáticamente PII en S3. Lake Formation permite el enmascaramiento de datos a nivel de columna. Amazon DataZone proporciona gobernanza de datos a nivel empresarial con seguimiento de linaje.

SageMaker Ground Truth gestiona el flujo de trabajo de etiquetado con tres opciones de mano de obra: Mechanical Turk para etiquetado público de alto volumen, Private Workforce para datos sensibles, y proveedores del Marketplace para dominios especializados. Ground Truth Plus es la opción completamente administrada.

 

Puntos Clave para el Examen

 

"Transformaciones visuales, 300+ integradas" -- SageMaker Data Wrangler "Preprocesamiento personalizado a gran escala, reproducible" -- SageMaker Processing "Recuperación de características en tiempo real para inferencia" -- Feature Store Online Store "Datos de entrenamiento por lotes, historial, viaje en el tiempo" -- Feature Store Offline Store "Prevenir sesgo entrenamiento-servicio" -- propósito principal de Feature Store "Perfilado de datos visual sin código" -- Amazon Glue DataBrew "Reglas DQ declarativas, verificaciones de calidad automatizadas" -- AWS Glue Data Quality "Detección de sesgo preentrenamiento, métricas CI y DPL" -- SageMaker Clarify "Detección de PII en S3" -- Amazon Macie "Etiquetado público de alto volumen" -- Ground Truth + Mechanical Turk

Volver a la lista del blog