AWS Bases de Datos y Análisis: Guía Completa

RDS, Aurora, DynamoDB, Redshift, Athena y más — domina todos los servicios de bases de datos y analytics de AWS con consejos clave para el examen CLF-C02 y comparaciones de casos de uso.

AWS Bases de Datos y Análisis: Guía Completa

Los servicios de bases de datos de AWS aparecen con frecuencia en el examen CLF-C02 en forma de preguntas del tipo "¿qué servicio elegirías en esta situación?". Comprender las características clave y los casos de uso de cada servicio es fundamental para aprobar el examen.

---

Base de Datos Relacional vs NoSQL — Conceptos Fundamentales

Bases de Datos Relacionales (SQL)

Los datos se almacenan en un esquema fijo (estructura de tablas) Los datos se consultan y gestionan mediante SQL Casos de uso: sistemas financieros, procesamiento de transacciones Ejemplos: MySQL, PostgreSQL, Oracle, SQL Server

Bases de Datos NoSQL

Esquema flexible (no requiere estructura predefinida) Optimizadas para escalado horizontal (Scale-Out) Casos de uso: aplicaciones en tiempo real, IoT, móvil Ejemplos: DynamoDB, DocumentDB

SQL es adecuado para datos estructurados y procesamiento transaccional, mientras que NoSQL es la elección correcta cuando se necesita un esquema flexible o un escalado horizontal masivo.

---

Amazon RDS — El Estándar para Bases de Datos Relacionales

RDS (Relational Database Service) es un servicio de base de datos relacional completamente administrado, operado y mantenido por AWS. AWS gestiona automáticamente los parches, las copias de seguridad y la configuración de alta disponibilidad, lo que permite a los desarrolladores centrarse en la lógica de la aplicación.

Motores Compatibles

MySQL, PostgreSQL, MariaDB, Oracle, SQL Server, Amazon Aurora

Instalación Directa en EC2 vs RDS

| Elemento | EC2 Directo | RDS | |----------|-------------|-----| | Parches del SO | Manual | Automático por AWS | | Copias de seguridad | Configuración manual | Automático + recuperación en un punto en el tiempo | | Alta Disponibilidad | Configuración manual | Multi-AZ integrado | | Read Replica | Configuración manual | Hasta 5, fácil de crear | | Acceso SSH | Disponible | No disponible |

RDS no permite el acceso SSH porque AWS administra directamente la infraestructura subyacente. Este punto se evalúa con frecuencia en el examen.

Opciones de Implementación de RDS

| Opción | Propósito | Características Clave | |--------|-----------|----------------------| | Read Replicas | Rendimiento de lectura | Replicación asíncrona, hasta 5, las escrituras van solo al primario | | Multi-AZ | Alta disponibilidad | Replicación síncrona, failover automático, una instancia en espera | | Multi-Region | Recuperación ante desastres + lecturas globales | Protege contra fallos de región, coste adicional de replicación |

Estas tres opciones tienen propósitos distintos. Read Replicas mejoran el rendimiento de lectura, Multi-AZ protege contra fallos de zona de disponibilidad, y Multi-Region proporciona recuperación ante desastres frente a una interrupción total de región.

---

Amazon Aurora — La Versión Premium de RDS

Aurora es una base de datos relacional de alto rendimiento desarrollada por AWS. Es compatible con MySQL y PostgreSQL y ofrece un rendimiento y disponibilidad significativamente superiores.

| Característica | Detalles | |---------------|----------| | Compatibilidad | Compatible con MySQL y PostgreSQL | | Rendimiento | 5 veces más rápido que MySQL, 3 veces más rápido que PostgreSQL | | Almacenamiento | Escalado automático (hasta 64TB) | | Read Replicas | Hasta 15 admitidas | | Coste | 20% más caro que RDS, pero más eficiente |

Aurora es la elección correcta para cargas de trabajo empresariales que requieren alto rendimiento y alta disponibilidad.

---

Amazon ElastiCache — Caché en Memoria

ElastiCache almacena en caché los resultados de consultas frecuentes en memoria, reduciendo la carga de la base de datos y mejorando los tiempos de respuesta. AWS gestiona automáticamente los parches del SO y las copias de seguridad como servicio completamente administrado.

| Motor | Características | |-------|----------------| | Redis | Soporte de replicación y persistencia, funciones avanzadas | | Memcached | Caché de memoria simple, rápido y ligero |

ElastiCache se sitúa delante de la base de datos como una caché en memoria de alto rendimiento, reduciendo drásticamente los tiempos de respuesta para solicitudes de lectura repetidas.

---

Amazon DynamoDB — NoSQL sin Servidor

DynamoDB es la base de datos NoSQL sin servidor completamente administrada de AWS. Puede gestionar millones de solicitudes sin ninguna administración de infraestructura, y admite billones de filas y cientos de terabytes de datos.

| Característica | Detalles | |---------------|----------| | Modelo de Datos | Clave-valor + documento | | Latencia | Un solo dígito de milisegundos | | Escalabilidad | Millones de req/s, billones de filas, cientos de TB | | Disponibilidad | Replicado automáticamente en 3 zonas de disponibilidad | | Gestión | Sin servidor — no requiere administración de infraestructura |

DynamoDB Accelerator (DAX)

Una caché en memoria creada específicamente para DynamoDB que reduce los tiempos de respuesta de milisegundos a microsegundos (μs).

DynamoDB Global Tables

Replicación multirregión (multi-master) Lecturas y escrituras con baja latencia desde cualquier parte del mundo

Las características definitorias de DynamoDB son: sin servidor + NoSQL + latencia de un solo dígito de milisegundos. Agregar DAX lleva las respuestas al nivel de microsegundos.

---

Servicios de Análisis y Almacenamiento de Datos

Amazon Redshift — Almacén de Datos

OLAP (Online Analytical Processing) — optimizado para consultas analíticas a gran escala Almacenamiento en columnas (Columnar Storage) → consultas de agregación rápidas Rendimiento 10 veces más rápido que otros almacenes de datos, escala de petabytes Interfaz SQL, integración con QuickSight y Tableau

Use RDS para procesamiento transaccional (OLTP) y Redshift para análisis a gran escala (OLAP).

Amazon Athena — Consultas SQL sin Servidor

Consulta directa de datos almacenados en S3 mediante SQL sin servidor Sin infraestructura que administrar, pague solo por los datos analizados ($5/TB) Admite CSV, JSON, Parquet, ORC y otros formatos Casos de uso: VPC Flow Logs, registros de ELB, análisis de CloudTrail

Cuando un escenario pregunte sobre el análisis de datos de S3 con SQL, Athena es la respuesta.

Amazon EMR — Procesamiento de Big Data

Clústeres de big data administrados basados en Hadoop, Spark y Hive Aprovisiona automáticamente clústeres de cientos de instancias EC2 Casos de uso: ETL a gran escala, aprendizaje automático, indexación web

Amazon QuickSight — Panel de BI

Herramienta de visualización de inteligencia empresarial (BI) sin servidor Se conecta a RDS, Redshift, S3 y otras fuentes de datos Modelo de precios por sesión, información basada en ML Casos de uso: paneles ejecutivos, visualización de datos

AWS Glue — ETL sin Servidor

Servicio ETL (Extract, Transform, Load) completamente administrado Sin servidor, prepara y transforma datos para análisis Glue Data Catalog: catálogo de datos que se integra con Athena, Redshift y EMR

---

Bases de Datos de Propósito Específico

DocumentDB — Base de Datos de Documentos Compatible con MongoDB

Base de datos administrada compatible con MongoDB desarrollada por AWS, similar a Aurora Optimizada para almacenamiento de documentos JSON, Multi-AZ, almacenamiento de escalado automático (hasta 64TB) Casos de uso: gestión de contenidos, catálogos, backends móviles

Amazon Neptune — Base de Datos de Grafos

Base de datos de grafos completamente administrada Consulta miles de millones de relaciones con latencia de milisegundos Casos de uso: redes sociales, detección de fraude, motores de recomendación, grafos de conocimiento (Wikipedia)

Amazon QLDB — Base de Datos de Libro Mayor

Volver a la lista del blog