Backup y recuperacion ante desastres (DR) tratan de una pregunta central: si ocurre lo peor, ¿con que rapidez podemos volver a la normalidad?
En terminos cotidianos, es como hacer una copia de documentos importantes antes de guardar los originales (backup) y tener un plan de evacuacion que detalla adonde ir y que tomar primero (estrategia DR). Sin preparacion, un desastre se convierte en caos. Lo mismo ocurre con los sistemas IT empresariales.
RTO y RPO — Las dos metricas fundamentales de la recuperacion ante desastres
Todo plan de recuperacion ante desastres comienza con dos preguntas.
RTO (Recovery Time Objective — Objetivo de tiempo de recuperacion): "¿Cuanto tiempo puede estar caido nuestro servicio antes de causar danos inaceptables?" Si tu RTO es 4 horas, debes restaurar el servicio dentro de 4 horas desde el fallo. Como un restaurante: "Incluso si hay un incendio, debemos reabrir en 4 horas."
RPO (Recovery Point Objective — Objetivo de punto de recuperacion): "¿Cuanta informacion podemos permitirnos perder?" Si tu RPO es 1 hora, puedes tolerar perder hasta 1 hora de datos. Esto tambien significa que debes hacer copias de seguridad al menos cada hora. Como el restaurante: "Podemos permitirnos perder el ultimo registro de pedidos de la ultima hora si es necesario."
| Metrica | La pregunta que responde | Ejemplo | |---------|------------------------|---------| | RTO | ¿Con que rapidez debemos recuperarnos? | El servicio debe reanudarse en 4 horas | | RPO | ¿Cuanta perdida de datos es aceptable? | Perder como maximo 1 hora de datos |
Un RTO y RPO mas cortos requieren soluciones mas caras. "Recuperar en 1 minuto sin perdida de datos" requiere la arquitectura Active-Active mas costosa.
AWS Backup — Un solo lugar para gestionar todas tus copias de seguridad
AWS ofrece docenas de servicios: EC2, RDS, DynamoDB, EFS, S3 y mas. Si configuras las copias de seguridad por separado para cada servicio, la gestion se vuelve compleja y propensa a errores. AWS Backup proporciona un unico servicio centralizado para gestionar las copias de seguridad de todos estos servicios.
Componentes clave
Un Plan de Copia de Seguridad es la politica que define cuando se ejecutan las copias de seguridad, cuanto tiempo se retienen y cuando pasan a almacenamiento mas barato. Por ejemplo: "Ejecutar una copia de seguridad cada dia a las 2 AM, conservarla durante 30 dias, luego moverla a almacenamiento frio despues de 90 dias."
Una Boveda de Copia de Seguridad es el contenedor logico donde se almacenan los datos de copia de seguridad. Como una caja de seguridad en un banco.
La Copia de Seguridad Interregional replica automaticamente las copias de seguridad a otra region de AWS. Si un desastre destruye la region principal, puedes restaurar desde la copia de seguridad en una region diferente.
La Copia de Seguridad entre Cuentas comparte copias de seguridad con una cuenta de AWS separada. Incluso si la cuenta principal es comprometida por un hacker o eliminada accidentalmente, la copia de seguridad en la cuenta separada permanece segura.
AWS Backup Vault Lock — Protegiendo tus copias de seguridad
Vault Lock hace imposible eliminar o modificar los datos de copia de seguridad durante un periodo determinado. Protege contra empleados maliciosos y ataques de ransomware que intentan destruir tus copias de seguridad. Esto se llama proteccion WORM (Write Once, Read Many — Escribir una vez, leer muchas). Una vez habilitado Vault Lock, ni siquiera los administradores pueden desactivarlo.
Instantaneas EBS — Fotos en un momento especifico de tu disco
Una instantanea captura el estado exacto de un volumen EBS en un momento especifico. Como guardar un juego, te permite restaurar a ese estado exacto mas tarde.
Caracteristicas clave:
Instantaneas incrementales: la primera instantanea copia el volumen completo. Las instantaneas posteriores solo almacenan los bloques que han cambiado desde la instantanea anterior. Esto ahorra un espacio de almacenamiento y costo significativo con el tiempo.
Fast Snapshot Restore (FSR): normalmente al restaurar un volumen desde una instantanea, comienza lentamente y gradualmente alcanza el maximo rendimiento. FSR pre-calienta el volumen para que ofrezca el maximo rendimiento inmediatamente al restaurarlo. Hay un costo adicional, pero es valioso cuando necesitas recuperarte rapidamente durante un desastre.
Data Lifecycle Manager (DLM): automatiza la creacion y eliminacion de instantaneas en un horario. Por ejemplo: "Crear una instantanea cada noche a medianoche. Eliminar instantaneas de mas de 7 dias."
Copia interregional: copia una instantanea a otra region para fines de DR.
Cifrado: las instantaneas de volumenes EBS cifrados se cifran automaticamente.
Copias de seguridad RDS — Protegiendo tu base de datos
Copias de seguridad automaticas vs Instantaneas manuales
| Caracteristica | Copias de seguridad automaticas | Instantaneas manuales | |---------------|--------------------------------|----------------------| | Como se crean | Automaticamente cada dia durante una ventana | Las activas manualmente | | Retencion | 0-35 dias (predeterminado 7, maximo 35) | Conservadas hasta que las elimines | | Recuperacion en un momento especifico | Si, hasta 5 minutos de precision | Solo al momento exacto de la instantanea | | Cuando se elimina la BD | Se eliminan automaticamente | Se conservan |
Punto critico del examen: la retencion de copias de seguridad automaticas de RDS es de maximo 35 dias. Si las normativas requieren conservar copias de seguridad durante 1 ano o 7 anos, debes usar instantaneas manuales.
!Copias de seguridad automáticas vs instantáneas manuales
Caracteristicas especiales de backup de Aurora
Aurora hace copias de seguridad continuas a S3 en segundo plano. Esto permite la recuperacion en un momento especifico (PITR) con precision de 1 segundo. RDS estandar admite PITR solo con precision de 5 minutos.
Backtrack es una funcion exclusiva de Aurora. En lugar de restaurar a una nueva instancia de base de datos, rebobina tu base de datos actual a un punto pasado en el tiempo de forma in situ. Esto es extremadamente rapido. Si alguien accidentalmente ejecuta una instruccion DELETE que borra millones de filas, puedes retroceder 5 minutos antes de que ocurriera sin crear una nueva instancia.
Control de versiones y replicacion de S3
S3 tambien proporciona multiples funciones de proteccion de datos.
Control de versiones: cuando esta habilitado, cada vez que se modifica o elimina un archivo, se conserva la version anterior. Si alguien elimina accidentalmente un archivo critico, puedes restaurar cualquier version anterior.
Replicacion interregional (CRR): copia automaticamente objetos a un bucket en una region diferente. Se usa para DR y para cumplir con normativas que exigen copias de datos en multiples ubicaciones geograficas.
Replicacion en la misma region (SRR): copia objetos a otro bucket dentro de la misma region. Se usa para distribuir datos entre entornos de desarrollo, preparacion y produccion.
S3 Object Lock: protege objetos usando WORM. Durante un periodo de retencion configurado, el objeto no puede eliminarse ni sobrescribirse. Se usa para cumplir con requisitos normativos y legales de retencion de datos.
Estrategias DR — Cuatro formas de recuperarse de un desastre
Hay cuatro estrategias DR principales, cada una con un equilibrio diferente entre costo y velocidad de recuperacion.
Backup and Restore
El metodo mas barato pero mas lento. Guardas copias de seguridad periodicamente, y cuando ocurre un desastre reconstruyes el entorno desde cero usando esas copias.
Analogia: despues de un incendio, cobras el seguro y reconstruyes la tienda desde cero.
RTO: horas. RPO: tiempo desde la ultima copia de seguridad. Costo: el mas bajo.
Pilot Light
Nombrado por la pequena llama que mantiene una calefaccion de gas lista para encenderse. Mantienes solo los sistemas mas criticos (como la base de datos) funcionando a escala minima en la region DR en todo momento. Todo lo demas esta apagado. Cuando ocurre un desastre, rapidamente inicias el resto del entorno alrededor de los sistemas centrales ya en funcionamiento.
Analogia: la cocina de respaldo siempre tiene el gas encendido y las ollas listas. Cuando ocurre el desastre, solo envias a los cocineros.
RTO: decenas de minutos a pocas horas. RPO: minutos. Costo: bajo.
Warm Standby
Una version completamente funcional pero reducida de todo tu entorno se ejecuta continuamente en la region DR. Cuando ocurre un desastre, la escala a plena capacidad para manejar todo el trafico de produccion.
Analogia: gestionas una segunda tienda al 50% de capacidad todo el tiempo. Si la tienda principal se quema, escalas la segunda tienda al 100%.
RTO: minutos. RPO: segundos a minutos. Costo: medio.
Active-Active (Multi-Site)