Arquitectura DR/resiliencia y visibilidad de costos

Domina las 4 estrategias DR, compensaciones RTO/RPO, Cost Explorer, Compute Optimizer y Savings Plans.

La Recuperacion ante Desastres (DR) y la visibilidad de costos son las dos ultimas tareas del Dominio 1 de SAP-C02. Aunque tienen menos preguntas, los conceptos de DR y costos aparecen repetidamente en otros dominios (D2, D3), lo que hace esencial dominarlos completamente.

El nucleo del diseno DR es definir primero "cuanto tiempo de inactividad y perdida de datos puede tolerar el negocio" y luego seleccionar la estrategia adecuada. La visibilidad de costos consiste en "entender donde se gasta el dinero y encontrar oportunidades de optimizacion."

 

Entendiendo RTO y RPO

RTO (Recovery Time Objective) es el tiempo maximo aceptable desde el fallo hasta la restauracion del servicio. RPO (Recovery Point Objective) es la perdida maxima aceptable de datos medida en tiempo.

Por ejemplo, si el RTO es 1 hora y el RPO es 15 minutos, el servicio debe restaurarse dentro de 1 hora del fallo y como maximo se pueden perder 15 minutos de datos.

Cuanto menor sea el RTO y RPO, mas infraestructura y mayor costo se necesita. El examen siempre evalua esta compensacion.

 

Las 4 estrategias DR

AWS define 4 estrategias DR donde el costo y la velocidad de recuperacion son inversamente proporcionales.

| Estrategia | RTO | RPO | Costo | Descripcion | |------------|-----|-----|-------|-------------| | Backup and Restore | Horas | Horas | Mas bajo | Restaurar desde backups. Aprovisionar infraestructura desde cero | | Pilot Light | Decenas de minutos | Minutos | Bajo | Solo infraestructura central (DB) ejecutandose. Resto aprovisionado en fallo | | Warm Standby | Minutos | Segundos a minutos | Medio | Entorno completo reducido ejecutandose. Escalar en fallo | | Multi-Site Active-Active | Casi cero | Casi cero | Mas alto | Ambas regiones sirven trafico simultaneamente. Failover instantaneo |

En Pilot Light, solo las replicas de base de datos (como RDS Cross-Region Read Replicas) se mantienen en la region DR. Los servidores web y de aplicacion se lanzan desde AMIs cuando ocurre un fallo. Warm Standby ejecuta todas las capas en estado reducido, por lo que solo es necesario escalar.

Elastic Disaster Recovery (DRS) es un servicio DR automatizado para escenarios de rehost. Replica continuamente servidores on-premises u otros clouds a AWS y puede recuperarlos como instancias EC2 en minutos.

 

Herramientas de visibilidad de costos

Entender y optimizar costos a nivel organizacional es una responsabilidad clave del Solutions Architect.

Cost Explorer visualiza costos y uso. Analiza costos por servicio, cuenta y etiqueta, e incluye predicciones para estimar gastos futuros. Activar las etiquetas de asignacion de costos permite mapear costos a unidades de negocio.

Trusted Advisor proporciona recomendaciones en 5 categorias: optimizacion de costos, rendimiento, seguridad, tolerancia a fallos y limites de servicio. Es particularmente util para identificar recursos no utilizados como instancias EC2 inactivas y volumenes EBS no conectados.

Compute Optimizer analiza patrones de uso de instancias EC2, grupos Auto Scaling, funciones Lambda y volumenes EBS para proporcionar recomendaciones de right-sizing. Usa datos de metricas de CloudWatch para identificar recursos sobre-aprovisionados y sub-aprovisionados.

 

Comparacion de opciones de compra

| Opcion | Descuento | Compromiso | Ideal para | |--------|-----------|------------|------------| | On-Demand | Ninguno | Ninguno | Cargas de trabajo impredecibles a corto plazo | | Reserved Instance | Hasta 72% | 1 ano/3 anos | Cargas de trabajo estables y predecibles | | Savings Plans (Compute) | Hasta 66% | 1 ano/3 anos | Flexibilidad de region/familia necesaria | | Savings Plans (EC2 Instance) | Hasta 72% | 1 ano/3 anos | Region+familia fija para maximo descuento | | Spot Instance | Hasta 90% | Ninguno | Cargas de trabajo batch/sin estado interrumpibles |

Los Savings Plans son mas flexibles que las Reserved Instances. Los Compute Savings Plans aplican a EC2, Fargate y Lambda, y el descuento se mantiene incluso al cambiar regiones o familias de instancias. Los EC2 Instance Savings Plans fijan una region y familia de instancias especificas a cambio de un mayor descuento.

S3 Storage Lens analiza patrones de uso de S3 en toda la organizacion. Visualiza uso de almacenamiento por bucket, patrones de solicitud y costos, e incluye deteccion de anomalias.

!Comparación de opciones de compra de EC2

Escenarios practicos

Escenario 1: Una empresa de servicios financieros requiere RPO de 5 minutos y RTO de 30 minutos. Backup-Restore tiene un RTO de horas, por lo que es inadecuado. Pilot Light (RDS Cross-Region Read Replica + recuperacion basada en AMI) es la opcion rentable.

Escenario 2: Una empresa de comercio electronico requiere cero tiempo de inactividad. Se necesita Multi-Site Active-Active (Route 53 enrutamiento basado en latencia + stack completo en dos regiones). Tiene el mayor costo pero logra RTO/RPO casi cero.

Escenario 3: Una startup necesita reducir los costos mensuales de AWS en un 30%. Usar Compute Optimizer para identificar EC2 sobre-aprovisionadas, aplicar Compute Savings Plans a cargas estables y usar Spot Instances para trabajos batch.

 

Puntos clave del examen

"DR de menor costo" -- Backup and Restore

"Solo DB central siempre activa, resto recuperado en fallo" -- Pilot Light

"Entorno completo reducido siempre en ejecucion" -- Warm Standby

"Cero tiempo de inactividad, failover instantaneo" -- Multi-Site Active-Active

"Menor RTO significa" -- mayor costo

"Replicacion DR de servidores on-premises a AWS" -- Elastic Disaster Recovery (DRS)

"Identificar EC2 sobre-aprovisionadas" -- Compute Optimizer

"Mapear costos a unidades de negocio" -- Etiquetas de asignacion de costos + Cost Explorer

"Descuento para EC2/Fargate/Lambda, flexible en region" -- Compute Savings Plans

"Analizar patrones de uso S3 en toda la org" -- S3 Storage Lens

"Identificar recursos no utilizados" -- Trusted Advisor

Volver a la lista del blog