En el examen SAA-C03, las estrategias de alta disponibilidad y recuperacion ante desastres (DR) representan aproximadamente el 20% de las preguntas. Los fallos del sistema son inevitables. Lo que importa es: "Con que rapidez puedes recuperarte y con cuanta perdida de datos?" Entender esto es la clave para responder correctamente las preguntas de DR.
RPO y RTO — Los dos pilares de la recuperacion ante desastres
Antes de entrar en las estrategias de DR, necesitas dominar dos conceptos fundamentales.
Piensalo como un diario personal. Escribes en tu diario todos los dias. Un dia se destruye en un incendio.
RPO (Recovery Point Objective) — Cuanta perdida de datos puedes tolerar:
Si hiciste una copia ayer, solo pierdes la entrada de hoy. Si tu ultima copia fue hace una semana, pierdes 7 dias de entradas. El RPO pregunta: "Cuanto tiempo de datos podemos permitirnos perder?" Cuanto menor sea el RPO, con mayor frecuencia necesitas hacer copias de seguridad.
RTO (Recovery Time Objective) — Con que rapidez debes volver a estar en linea:
Despues de que se quema tu diario, cuanto tiempo necesitas para conseguir uno nuevo? Si tienes que ir a una tienda y tardas una hora, tu RTO es una hora. El RTO pregunta: "Que tan rapido debe restaurarse el sistema despues de un fallo?" Cuanto menor sea el RTO, mas infraestructura en espera necesitas funcionando en todo momento.
Principio fundamental: Cuanto menores sean tus objetivos de RPO y RTO, mas infraestructura necesitas y mayores seran los costos.
4 estrategias de DR — Piensalas como polizas de seguro
Las cuatro estrategias de recuperacion ante desastres se corresponden perfectamente con polizas de seguro. A medida que aumenta tu "prima" (costo), tambien aumenta tu cobertura (velocidad de recuperacion).
Backup and Restore — Seguro basico del hogar
La estrategia mas economica. Realizas copias de seguridad regulares y cuando ocurre un fallo, restauras todo desde cero.
Analogia del seguro: Si tu casa se incendia, presentas una reclamacion y eventualmente recibes dinero para reconstruir. La prima es baja, pero podrías estar sin hogar durante meses.
RPO: Alto (pierdes todos los datos desde la ultima copia de seguridad) RTO: Alto (horas o dias) Costo: El mas bajo Casos de uso: Sistemas no criticos, entornos de desarrollo y pruebas
Pilot Light — Mantener siempre una llama minima encendida
Solo la infraestructura central mas critica (tipicamente la base de datos) funciona con capacidad minima en todo momento. El resto (servidores web, servidores de aplicaciones) esta apagado. Cuando ocurre un fallo, activas rapidamente los componentes restantes.
Analogia de la cocina de gas: Un piloto en una cocina de gas es una llama diminuta que permanece encendida todo el tiempo. Cuando necesitas cocinar, simplemente giras el mando y la llama completa se enciende en segundos.
RPO: Medio (la BD se replica continuamente, por lo que la perdida de datos es minima) RTO: Medio (decenas de minutos) Costo: Bajo a medio Casos de uso: Proteger bases de datos criticas manteniendo bajos los costos generales de infraestructura
Warm Standby — Un equipo reducido completo siempre en espera
Una version reducida pero completamente funcional de todo el entorno de produccion esta en funcionamiento en todo momento. Cuando ocurre un fallo, la escalas a plena capacidad de produccion.
Analogia del seguro: Tienes un pequeno apartamento temporal siempre listo y amueblado. Es un poco pequeno, pero puedes mudarte de inmediato despues de un desastre mientras se reconstruye tu hogar principal.
RPO: Bajo RTO: Bajo (minutos) Costo: Medio a alto Casos de uso: Sistemas empresariales importantes donde se acepta algun tiempo de inactividad pero debe ser minimo
Active-Active — Dos oficinas completamente operativas funcionando simultaneamente
Ambas regiones de AWS manejan simultaneamente todo el trafico de produccion. Si una region cae completamente, la otra absorbe todo el trafico instantaneamente sin interrupcion.
Analogia del seguro: Tienes dos oficinas en diferentes ciudades, cada una completamente dotada de personal identico y equipamiento. Si la oficina de Madrid se inunda, todos los empleados ya estan trabajando en Barcelona. Los clientes nunca notan que algo paso.
RPO: Casi cero RTO: Casi cero (segundos) Costo: El mas alto (infraestructura identica en dos regiones simultaneamente) Casos de uso: Finanzas, sanidad, comercio electronico donde incluso un minuto de inactividad es inaceptable
!Comparación de 4 estrategias de recuperación ante desastres
Patrones de alta disponibilidad por servicio
Entender como cada servicio de AWS implementa la alta disponibilidad te ayuda a identificar rapidamente la respuesta correcta cuando el examen pregunta "que servicio deberias usar?"
EC2 Alta Disponibilidad
Distribuye instancias en multiples Zonas de Disponibilidad (AZs), luego combina con un Auto Scaling Group y un Application Load Balancer (ALB). El patron esencial de tres piezas: Multi-AZ + Auto Scaling + ALB.
RDS Multi-AZ
RDS Multi-AZ mantiene una instancia primaria y una instancia en espera replicada sincronamente en una AZ diferente.
Replicacion sincrona: cada escritura se aplica inmediatamente al respaldo antes de que el primario confirme el exito Failover automatico: si el primario falla, el respaldo se promueve automaticamente en minutos Distincion importante: Multi-AZ es para alta disponibilidad, NO para escalar lecturas. Usa Read Replicas para eso.
Aurora Global Database
Aurora mantiene 6 copias de datos en 3 Zonas de Disponibilidad por defecto. Con Aurora Global Database, puedes replicar en multiples regiones de AWS, con regiones secundarias que reciben actualizaciones con latencia inferior a un segundo.
DynamoDB Global Tables
Una base de datos multi-region y multi-activa completamente administrada que admite lecturas y escrituras simultaneas desde multiples regiones. Este es el ejemplo clasico del patron activo-activo.
Politicas de enrutamiento de Route 53
Route 53 va mas alla de la simple resolucion de DNS. Proporciona enrutamiento inteligente del trafico que juega un papel central en las arquitecturas de alta disponibilidad.
| Politica | Cuando usarla | Palabras clave del examen | |---------|--------------|--------------------------| | Failover | Cambiar automaticamente al respaldo cuando falla el primario | "failover automatico", "enrutamiento DR" | | Latency | Enrutar usuarios a la region con menor latencia | "respuesta mas rapida", "minimizar latencia" | | Weighted | Dividir trafico por porcentaje (ej: 90/10) | "despliegue canary", "prueba A/B" | | Geolocation | Enrutar basandose en la ubicacion geografica del usuario | "usuarios de un pais especifico", "cumplimiento regional" | | Geoproximity | Basado en distancia geografica con sesgo ajustable | "trasladar mas trafico a una region especifica" |
Puntos clave del examen
"Estrategia DR mas economica" -- Backup and Restore
"Solo la BD central funcionando minimamente, activar el resto rapidamente en caso de fallo" -- Pilot Light
"Sistema completo reducido siempre en ejecucion, escalar en caso de fallo" -- Warm Standby
"RPO/RTO casi cero, estrategia mas cara" -- Active-Active
"RPO = tolerancia a perdida de datos, RTO = objetivo de tiempo de recuperacion" -- ambos bajan al aumentar el costo