Imagina un fallo en el pipeline de datos: alguien eliminó accidentalmente datos críticos, un usuario no autorizado accedió a un archivo sensible, o ocurrió una violación de cumplimiento. Cuando estos eventos suceden, necesitas poder responder "cuándo, quién y qué" con certeza. Para eso sirven los registros de auditoría. Y cuando tus datos incluyen información personal, también necesitas gobernanza de privacidad de datos — un enfoque sistemático para proteger esos datos y demostrar el cumplimiento. Esta guía explica cómo AWS proporciona registro de auditoría, detección de PII, controles de soberanía de datos y marcos de gobernanza.
Registros de Auditoría — Construyendo un Registro Completo
Un registro de auditoría es un registro cronológico de eventos significativos en un sistema. Captura quién realizó una acción, cuándo ocurrió, desde dónde y cuál fue el resultado. En AWS, dos servicios manejan la mayor parte del registro de auditoría: CloudTrail para la actividad de la API de AWS y CloudWatch Logs para la actividad a nivel de aplicación.
AWS CloudTrail — La Caja Negra de tu Cuenta AWS
CloudTrail registra cada llamada de API realizada en tu cuenta AWS. Cada vez que un usuario, rol IAM o servicio de AWS realiza una solicitud de API — crear un bucket S3, ejecutar un trabajo Glue, modificar un grupo de seguridad — CloudTrail lo registra. Piénsalo como la caja negra de un avión: cuando algo sale mal, puedes examinar el historial de CloudTrail para reconstruir exactamente lo que ocurrió.
CloudTrail registra dos categorías de eventos:
Los Eventos de Administración cubren acciones que crean, modifican o eliminan recursos de AWS. Iniciar o detener una instancia EC2, crear o eliminar un bucket S3, cambiar permisos IAM, lanzar o detener un trabajo ETL de Glue. Están habilitados por defecto sin costo adicional.
Los Eventos de Datos cubren interacciones directas con los datos dentro de los recursos de AWS. Leer un objeto S3 (GetObject), subir un archivo (PutObject), invocar una función Lambda, acceder a un elemento DynamoDB. Los eventos de datos están deshabilitados por defecto porque generan enormes volúmenes de entradas de registro. Los habilitas selectivamente en buckets S3 o funciones Lambda específicas donde necesitas rastros de auditoría detallados. Hay un costo adicional por evento registrado.
CloudTrail Lake es un almacén de eventos administrado que mantiene los eventos de CloudTrail en un formato que puedes consultar directamente con SQL. Puedes ejecutar consultas como "muéstrame cada llamada de API que accedió al bucket prod-finance en los últimos 30 días, agrupada por el rol IAM que realizó la llamada."
Amazon CloudWatch Logs — Registro Centralizado de Aplicaciones
Mientras CloudTrail registra la actividad de la API de AWS, CloudWatch Logs recopila los registros operativos generados por los servicios de AWS mientras se ejecutan. Cuando un trabajo ETL de Glue se ejecuta, genera registros sobre qué archivos procesó, errores encontrados y cuánto tiempo tomó cada paso. Todos estos fluyen hacia CloudWatch Logs.
Capacidades clave de CloudWatch Logs:
La configuración de retención de registros establece cuánto tiempo conservar los registros — desde 1 día hasta indefinidamente. Las regulaciones pueden requerir una retención de 7 años para registros de auditoría financiera.
CloudWatch Logs Insights proporciona una interfaz de consulta interactiva para tus registros usando un lenguaje de consulta similar a SQL. Puedes preguntar "¿qué función Lambda tuvo más entradas de registro ERROR en la última hora?" sin exportar los datos a ningún lado.
Los Filtros de Métricas extraen patrones del texto de registro y los convierten en métricas de CloudWatch. Si creas un filtro de métricas en registros de Glue que coincida con el texto "ERROR", cada ocurrencia incrementa una métrica error_count. Puedes crear una Alarma de CloudWatch en esa métrica para recibir notificaciones cuando supere un umbral.
Integración de Registros Multi-Servicio
Tres patrones arquitectónicos ayudan a analizar registros de toda la plataforma:
El patrón de centralización de CloudWatch Logs enruta todos los registros de servicios a CloudWatch Logs y usa Logs Insights como interfaz de consulta unificada.
El patrón S3 + Athena almacena registros en S3 para retención a largo plazo y rentable, y usa Athena para consultas SQL bajo demanda. Ideal para archivos de auditoría de cumplimiento.
Amazon OpenSearch Service maneja la búsqueda y visualización en tiempo real de grandes volúmenes de registros. Los registros fluyen continuamente a través de Kinesis Data Firehose, y los operadores usan paneles de Kibana para monitorear la plataforma en tiempo real.
Privacidad de Datos — Protegiendo la Información Personal
La gobernanza de privacidad de datos determina cómo proteger la información personal — identificar dónde viven los datos sensibles, hacer cumplir reglas sobre quién puede verlos y garantizar que los datos permanezcan en la ubicación geográfica correcta.
Identificación de PII — Encontrar Datos Sensibles
PII (Información de Identificación Personal) es cualquier dato que pueda usarse para identificar a un individuo específico: nombres, direcciones de correo electrónico, números de teléfono, números de identificación nacional, números de tarjetas de crédito y más.
Amazon Macie es un servicio de seguridad de datos completamente administrado que usa aprendizaje automático para descubrir y clasificar automáticamente PII en buckets S3. El modelo ML de Macie está entrenado para reconocer docenas de tipos de datos sensibles:
Datos financieros: números de tarjeta de crédito, números de cuenta bancaria Datos de salud: códigos de diagnóstico, información de prescripciones Identificadores personales: nombres completos, direcciones, correos electrónicos, teléfonos Credenciales: claves API, contraseñas, claves de acceso AWS en archivos Identificadores gubernamentales: números de seguridad social, números de pasaporte
La integración entre Macie y Lake Formation crea un flujo de trabajo de protección de privacidad poderoso. Macie identifica qué tablas contienen PII. Luego puedes usar Lake Formation para aplicar control de acceso a nivel de columna en esas tablas específicas.
Soberanía de Datos — Asegurando que los Datos Permanezcan en el Lugar Correcto
La soberanía de datos es el concepto de que los datos están sujetos a las leyes del país donde residen físicamente.
Las Regiones de AWS son grupos de centros de datos físicamente separados en ubicaciones geográficas específicas. Los datos almacenados en la Región de Seúl (ap-northeast-2) residen en Corea del Sur y no salen de esa región a menos que configures explícitamente la replicación.
La Replicación de S3 entre Regiones (CRR) requiere una gobernanza cuidadosa. Si la ley de privacidad coreana requiere que los datos de ciudadanos coreanos permanezcan en Corea, replicarlos a la región us-east-1 sería una violación.
Las copias de seguridad y snapshots siguen las mismas reglas. Las reglas de AWS Config pueden monitorear las copias de snapshots entre regiones y marcarlas como no conformes.
Marco de Gobernanza — Reglas Sistemáticas y Cumplimiento Automatizado
AWS Config — Monitoreo Continuo de Cumplimiento
AWS Config rastrea el estado de configuración de tus recursos de AWS a lo largo del tiempo y los evalúa con respecto a reglas que defines.
Ejemplos de reglas Config relevantes para la ingeniería de datos:
"Todos los buckets S3 deben tener el cifrado del lado del servidor habilitado" — Config evalúa cada bucket S3 y marca cualquier bucket no cifrado como no conforme.
"Los buckets S3 deben bloquear todo el acceso público" — Cualquier bucket donde el acceso público está permitido se marca inmediatamente.
"Las instancias RDS deben estar cifradas" — Las instancias de base de datos no cifradas no son conformes.
Cuando Config encuentra un recurso no conforme, lo marca en el panel, registra la línea de tiempo de cumplimiento y puede enviar notificaciones a través de EventBridge o SNS. También puedes configurar acciones de corrección automática.
Lake Formation como Plataforma de Gobernanza
Lake Formation proporciona la capa de aplicación de políticas para todo tu data lake. Hace cumplir quién puede ver qué datos en el momento de la consulta, independientemente de qué herramienta de consulta se use — Athena, Redshift Spectrum, EMR, Glue.
La linaje de datos rastrea cómo fluyen los datos a través de tu pipeline — de qué sistema fuente provino, qué transformaciones sufrió, qué sistemas downstream lo consumen. Lake Formation se integra con Glue Data Catalog para proporcionar visibilidad de linaje.
Al compartir datos a través de Redshift Data Sharing, los filtros de Lake Formation se aplican a los datos compartidos. Un socio consumiendo tus datos Redshift compartidos solo puede ver las columnas y filas que permites explícitamente.
Referencia Rápida para el Examen
| Palabra Clave del Examen | Respuesta | |------------------------|-----------| | Registrar todas las llamadas de API de AWS | AWS CloudTrail | | Registrar lecturas y escrituras de objetos S3 (requiere configuración extra) | Eventos de datos de CloudTrail | | Consultar registros de CloudTrail con SQL | CloudTrail Lake | | Recopilación centralizada de registros de aplicaciones | Amazon CloudWatch Logs | | Consultas tipo SQL en datos de registro | CloudWatch Logs Insights | | Convertir patrones de registro en métricas | Filtros de Métricas de CloudWatch | | Búsqueda y visualización en tiempo real de grandes volúmenes de registros | Amazon OpenSearch Service | | Detectar automáticamente PII en S3 con ML | Amazon Macie | | Monitoreo automatizado de cumplimiento de reglas para recursos | AWS Config | | Almacenar datos en ubicación geográfica específica por ley | Soberanía de datos (selección de región) | | Plataforma de gobernanza central para data lake | AWS Lake Formation | | CloudTrail vs CloudWatch Logs | CloudTra