AWS Bases de Datos y Análisis: Guía Completa
Los servicios de bases de datos de AWS aparecen con frecuencia en el examen CLF-C02 en forma de preguntas del tipo "¿qué servicio elegirías en esta situación?". Comprender las características clave y los casos de uso de cada servicio es fundamental para aprobar el examen.
---
Base de Datos Relacional vs NoSQL — Conceptos Fundamentales
Bases de Datos Relacionales (SQL)
Los datos se almacenan en un esquema fijo (estructura de tablas) Los datos se consultan y gestionan mediante SQL Casos de uso: sistemas financieros, procesamiento de transacciones Ejemplos: MySQL, PostgreSQL, Oracle, SQL Server
Bases de Datos NoSQL
Esquema flexible (no requiere estructura predefinida) Optimizadas para escalado horizontal (Scale-Out) Casos de uso: aplicaciones en tiempo real, IoT, móvil Ejemplos: DynamoDB, DocumentDB
SQL es adecuado para datos estructurados y procesamiento transaccional, mientras que NoSQL es la elección correcta cuando se necesita un esquema flexible o un escalado horizontal masivo.
---
Amazon RDS — El Estándar para Bases de Datos Relacionales
RDS (Relational Database Service) es un servicio de base de datos relacional completamente administrado, operado y mantenido por AWS. AWS gestiona automáticamente los parches, las copias de seguridad y la configuración de alta disponibilidad, lo que permite a los desarrolladores centrarse en la lógica de la aplicación.
Motores Compatibles
MySQL, PostgreSQL, MariaDB, Oracle, SQL Server, Amazon Aurora
Instalación Directa en EC2 vs RDS
| Elemento | EC2 Directo | RDS | |----------|-------------|-----| | Parches del SO | Manual | Automático por AWS | | Copias de seguridad | Configuración manual | Automático + recuperación en un punto en el tiempo | | Alta Disponibilidad | Configuración manual | Multi-AZ integrado | | Read Replica | Configuración manual | Hasta 5, fácil de crear | | Acceso SSH | Disponible | No disponible |
RDS no permite el acceso SSH porque AWS administra directamente la infraestructura subyacente. Este punto se evalúa con frecuencia en el examen.
Opciones de Implementación de RDS
| Opción | Propósito | Características Clave | |--------|-----------|----------------------| | Read Replicas | Rendimiento de lectura | Replicación asíncrona, hasta 5, las escrituras van solo al primario | | Multi-AZ | Alta disponibilidad | Replicación síncrona, failover automático, una instancia en espera | | Multi-Region | Recuperación ante desastres + lecturas globales | Protege contra fallos de región, coste adicional de replicación |
Estas tres opciones tienen propósitos distintos. Read Replicas mejoran el rendimiento de lectura, Multi-AZ protege contra fallos de zona de disponibilidad, y Multi-Region proporciona recuperación ante desastres frente a una interrupción total de región.
---
Amazon Aurora — La Versión Premium de RDS
Aurora es una base de datos relacional de alto rendimiento desarrollada por AWS. Es compatible con MySQL y PostgreSQL y ofrece un rendimiento y disponibilidad significativamente superiores.
| Característica | Detalles | |---------------|----------| | Compatibilidad | Compatible con MySQL y PostgreSQL | | Rendimiento | 5 veces más rápido que MySQL, 3 veces más rápido que PostgreSQL | | Almacenamiento | Escalado automático (hasta 64TB) | | Read Replicas | Hasta 15 admitidas | | Coste | 20% más caro que RDS, pero más eficiente |
Aurora es la elección correcta para cargas de trabajo empresariales que requieren alto rendimiento y alta disponibilidad.
---
Amazon ElastiCache — Caché en Memoria
ElastiCache almacena en caché los resultados de consultas frecuentes en memoria, reduciendo la carga de la base de datos y mejorando los tiempos de respuesta. AWS gestiona automáticamente los parches del SO y las copias de seguridad como servicio completamente administrado.
| Motor | Características | |-------|----------------| | Redis | Soporte de replicación y persistencia, funciones avanzadas | | Memcached | Caché de memoria simple, rápido y ligero |
ElastiCache se sitúa delante de la base de datos como una caché en memoria de alto rendimiento, reduciendo drásticamente los tiempos de respuesta para solicitudes de lectura repetidas.
---
Amazon DynamoDB — NoSQL sin Servidor
DynamoDB es la base de datos NoSQL sin servidor completamente administrada de AWS. Puede gestionar millones de solicitudes sin ninguna administración de infraestructura, y admite billones de filas y cientos de terabytes de datos.
| Característica | Detalles | |---------------|----------| | Modelo de Datos | Clave-valor + documento | | Latencia | Un solo dígito de milisegundos | | Escalabilidad | Millones de req/s, billones de filas, cientos de TB | | Disponibilidad | Replicado automáticamente en 3 zonas de disponibilidad | | Gestión | Sin servidor — no requiere administración de infraestructura |
DynamoDB Accelerator (DAX)
Una caché en memoria creada específicamente para DynamoDB que reduce los tiempos de respuesta de milisegundos a microsegundos (μs).
DynamoDB Global Tables
Replicación multirregión (multi-master) Lecturas y escrituras con baja latencia desde cualquier parte del mundo
Las características definitorias de DynamoDB son: sin servidor + NoSQL + latencia de un solo dígito de milisegundos. Agregar DAX lleva las respuestas al nivel de microsegundos.
---
Servicios de Análisis y Almacenamiento de Datos
Amazon Redshift — Almacén de Datos
OLAP (Online Analytical Processing) — optimizado para consultas analíticas a gran escala Almacenamiento en columnas (Columnar Storage) → consultas de agregación rápidas Rendimiento 10 veces más rápido que otros almacenes de datos, escala de petabytes Interfaz SQL, integración con QuickSight y Tableau
Use RDS para procesamiento transaccional (OLTP) y Redshift para análisis a gran escala (OLAP).
Amazon Athena — Consultas SQL sin Servidor
Consulta directa de datos almacenados en S3 mediante SQL sin servidor Sin infraestructura que administrar, pague solo por los datos analizados ($5/TB) Admite CSV, JSON, Parquet, ORC y otros formatos Casos de uso: VPC Flow Logs, registros de ELB, análisis de CloudTrail
Cuando un escenario pregunte sobre el análisis de datos de S3 con SQL, Athena es la respuesta.
Amazon EMR — Procesamiento de Big Data
Clústeres de big data administrados basados en Hadoop, Spark y Hive Aprovisiona automáticamente clústeres de cientos de instancias EC2 Casos de uso: ETL a gran escala, aprendizaje automático, indexación web
Amazon QuickSight — Panel de BI
Herramienta de visualización de inteligencia empresarial (BI) sin servidor Se conecta a RDS, Redshift, S3 y otras fuentes de datos Modelo de precios por sesión, información basada en ML Casos de uso: paneles ejecutivos, visualización de datos
AWS Glue — ETL sin Servidor
Servicio ETL (Extract, Transform, Load) completamente administrado Sin servidor, prepara y transforma datos para análisis Glue Data Catalog: catálogo de datos que se integra con Athena, Redshift y EMR
---
Bases de Datos de Propósito Específico
DocumentDB — Base de Datos de Documentos Compatible con MongoDB
Base de datos administrada compatible con MongoDB desarrollada por AWS, similar a Aurora Optimizada para almacenamiento de documentos JSON, Multi-AZ, almacenamiento de escalado automático (hasta 64TB) Casos de uso: gestión de contenidos, catálogos, backends móviles
Amazon Neptune — Base de Datos de Grafos
Base de datos de grafos completamente administrada Consulta miles de millones de relaciones con latencia de milisegundos Casos de uso: redes sociales, detección de fraude, motores de recomendación, grafos de conocimiento (Wikipedia)
Amazon QLDB — Base de Datos de Libro Mayor