Arquitetura DR/resiliência e visibilidade de custos

Domine as 4 estrategias DR, compensacoes RTO/RPO, Cost Explorer, Compute Optimizer e Savings Plans.

Recuperacao de Desastres (DR) e visibilidade de custos sao as duas ultimas tarefas do Dominio 1 do SAP-C02. Embora tenham menos questoes, os conceitos de DR e custos aparecem repetidamente em outros dominios (D2, D3), tornando essencial domina-los completamente.

O nucleo do design de DR e definir primeiro "quanto tempo de inatividade e perda de dados o negocio pode tolerar" e depois selecionar a estrategia adequada. A visibilidade de custos trata de "entender onde o dinheiro esta sendo gasto e encontrar oportunidades de otimizacao."

 

Entendendo RTO e RPO

RTO (Recovery Time Objective) e o tempo maximo aceitavel desde a falha ate a restauracao do servico. RPO (Recovery Point Objective) e a perda maxima aceitavel de dados medida em tempo.

Por exemplo, se o RTO e 1 hora e o RPO e 15 minutos, o servico deve ser restaurado dentro de 1 hora da falha, e no maximo 15 minutos de dados podem ser perdidos.

Quanto menor o RTO e RPO, mais infraestrutura e maior custo sao necessarios. O exame sempre testa essa compensacao.

 

As 4 estrategias de DR

A AWS define 4 estrategias de DR onde custo e velocidade de recuperacao sao inversamente proporcionais.

| Estrategia | RTO | RPO | Custo | Descricao | |------------|-----|-----|-------|-----------| | Backup and Restore | Horas | Horas | Mais baixo | Restaurar de backups. Provisionar infraestrutura do zero | | Pilot Light | Dezenas de minutos | Minutos | Baixo | Apenas infraestrutura central (DB) rodando. Resto provisionado na falha | | Warm Standby | Minutos | Segundos a minutos | Medio | Ambiente completo reduzido rodando. Escalar na falha | | Multi-Site Active-Active | Quase zero | Quase zero | Mais alto | Ambas regioes servem trafego simultaneamente. Failover instantaneo |

No Pilot Light, apenas replicas de banco de dados (como RDS Cross-Region Read Replicas) sao mantidas na regiao DR. Servidores web e de aplicacao sao lancados de AMIs quando uma falha ocorre. O Warm Standby roda todas as camadas em estado reduzido, entao apenas escalar e necessario.

O Elastic Disaster Recovery (DRS) e um servico de DR automatizado para cenarios de rehost. Replica continuamente servidores on-premises ou de outras nuvens para a AWS e pode recupera-los como instancias EC2 em minutos.

 

Ferramentas de visibilidade de custos

Entender e otimizar custos no nivel organizacional e uma responsabilidade chave do Solutions Architect.

O Cost Explorer visualiza custos e uso. Analisa custos por servico, conta e tag, e inclui previsoes para estimar gastos futuros. Ativar tags de alocacao de custos permite mapear custos para unidades de negocio.

O Trusted Advisor fornece recomendacoes em 5 categorias: otimizacao de custos, desempenho, seguranca, tolerancia a falhas e limites de servico. E particularmente util para identificar recursos nao utilizados como instancias EC2 ociosas e volumes EBS nao conectados.

O Compute Optimizer analisa padroes de uso de instancias EC2, grupos Auto Scaling, funcoes Lambda e volumes EBS para fornecer recomendacoes de right-sizing. Usa dados de metricas do CloudWatch para identificar recursos super-provisionados e sub-provisionados.

 

Comparacao de opcoes de compra

| Opcao | Desconto | Compromisso | Ideal para | |-------|----------|-------------|------------| | On-Demand | Nenhum | Nenhum | Cargas de trabalho imprevisiveis de curto prazo | | Reserved Instance | Ate 72% | 1 ano/3 anos | Cargas de trabalho estaveis e previsiveis | | Savings Plans (Compute) | Ate 66% | 1 ano/3 anos | Flexibilidade de regiao/familia necessaria | | Savings Plans (EC2 Instance) | Ate 72% | 1 ano/3 anos | Regiao+familia fixa para desconto maximo | | Spot Instance | Ate 90% | Nenhum | Cargas de trabalho batch/sem estado interrumpiveis |

Os Savings Plans sao mais flexiveis que Reserved Instances. Compute Savings Plans aplicam-se a EC2, Fargate e Lambda, e o desconto persiste mesmo ao mudar regioes ou familias de instancias. EC2 Instance Savings Plans fixam uma regiao e familia de instancias especificas em troca de um desconto maior.

O S3 Storage Lens analisa padroes de uso do S3 em toda a organizacao. Visualiza uso de armazenamento por bucket, padroes de solicitacao e custos, e inclui deteccao de anomalias.

!Comparação das opções de compra do EC2

Cenarios praticos

Cenario 1: Uma empresa de servicos financeiros exige RPO de 5 minutos e RTO de 30 minutos. Backup-Restore tem RTO de horas, entao e inadequado. Pilot Light (RDS Cross-Region Read Replica + recuperacao baseada em AMI) e a escolha economica.

Cenario 2: Uma empresa de e-commerce exige zero tempo de inatividade. Multi-Site Active-Active (Route 53 roteamento baseado em latencia + stack completo em duas regioes) e necessario. Tem o maior custo mas alcanca RTO/RPO quase zero.

Cenario 3: Uma startup precisa reduzir custos mensais da AWS em 30%. Usar Compute Optimizer para identificar EC2 super-provisionadas, aplicar Compute Savings Plans a cargas estaveis e usar Spot Instances para jobs batch.

 

Pontos-chave do exame

"DR de menor custo" -- Backup and Restore

"Apenas DB central sempre ativa, resto recuperado na falha" -- Pilot Light

"Ambiente completo reduzido sempre rodando" -- Warm Standby

"Zero tempo de inatividade, failover instantaneo" -- Multi-Site Active-Active

"Menor RTO significa" -- maior custo

"Replicacao DR de servidores on-premises para AWS" -- Elastic Disaster Recovery (DRS)

"Identificar EC2 super-provisionadas" -- Compute Optimizer

"Mapear custos para unidades de negocio" -- Tags de alocacao de custos + Cost Explorer

"Desconto para EC2/Fargate/Lambda, flexivel em regiao" -- Compute Savings Plans

"Analisar padroes de uso S3 em toda a org" -- S3 Storage Lens

"Identificar recursos nao utilizados" -- Trusted Advisor

Voltar à lista do blog