Arquiteturas de alta disponibilidade

Projete recuperacao de desastres com Pilot Light, Warm Standby, RPO/RTO e Multi-AZ/Regiao.

No exame SAA-C03, as estrategias de alta disponibilidade e recuperacao de desastres (DR) representam aproximadamente 20% das questoes. Falhas no sistema sao inevitaveis. O que importa e: "Com que rapidez voce pode se recuperar e com quanta perda de dados?" Entender isso e a chave para responder corretamente as questoes de DR.

 

RPO e RTO — Os dois pilares da recuperacao de desastres

Antes de entrar nas estrategias de DR, voce precisa dominar dois conceitos fundamentais.

Pense nisso como um diario pessoal. Voce escreve no seu diario todos os dias. Um dia ele e destruido num incendio.

RPO (Recovery Point Objective) — Quanta perda de dados voce pode tolerar:

Se voce fez uma copia ontem, so perde a entrada de hoje. Se sua ultima copia foi ha uma semana, voce perde 7 dias de entradas. O RPO pergunta: "Quanto tempo de dados podemos perder?" Quanto menor o RPO, com mais frequencia voce precisa fazer backup dos dados.

RTO (Recovery Time Objective) — Com que rapidez voce deve voltar a ficar online:

Depois que seu diario queima, quanto tempo voce precisa para conseguir um novo? Se voce tem que ir a uma loja e leva uma hora, seu RTO e uma hora. O RTO pergunta: "Com que rapidez o sistema deve ser restaurado apos uma falha?" Quanto menor o RTO, mais infraestrutura em standby voce precisa funcionando o tempo todo.

Principio fundamental: Quanto menores forem seus objetivos de RPO e RTO, mais infraestrutura voce precisa e maiores serao os custos.

 

4 estrategias de DR — Pense nelas como apolices de seguro

As quatro estrategias de recuperacao de desastres mapeiam-se perfeitamente em apolices de seguro. A medida que o "premio" (custo) aumenta, tambem aumenta a cobertura (velocidade de recuperacao).

 

Backup and Restore — Seguro basico residencial

A estrategia mais barata. Voce faz backups regulares e quando uma falha acontece, restaura tudo do zero.

Analogia do seguro: Se sua casa pega fogo, voce entra com um sinistro e eventualmente recebe dinheiro para reconstruir. O premio e baixo, mas voce pode ficar sem casa por meses.

RPO: Alto (voce perde todos os dados desde o ultimo backup) RTO: Alto (horas a dias) Custo: O mais baixo Casos de uso: Sistemas nao criticos, ambientes de desenvolvimento e teste

 

Pilot Light — Sempre manter uma chama minima acesa

Apenas a infraestrutura central mais critica (tipicamente o banco de dados) funciona com capacidade minima o tempo todo. O resto (servidores web, servidores de aplicacao) fica desligado. Quando uma falha ocorre, voce liga rapidamente os componentes restantes.

Analogia do fogao a gas: Um piloto num fogao a gas e uma chama minuscula que fica acesa o tempo todo. Quando voce precisa cozinhar, simplesmente gira o botao e a chama completa acende em segundos.

RPO: Medio (o banco de dados e continuamente replicado, entao a perda de dados e minima) RTO: Medio (dezenas de minutos) Custo: Baixo a medio Casos de uso: Proteger bancos de dados criticos mantendo os custos gerais de infraestrutura baixos

 

Warm Standby — Uma equipe completa reduzida sempre em espera

Uma versao reduzida mas completamente funcional de todo o ambiente de producao fica em execucao o tempo todo. Quando uma falha ocorre, voce a escala para a capacidade completa de producao.

Analogia do seguro: Voce tem um pequeno apartamento temporario sempre pronto e mobiliado. E um pouco apertado, mas voce pode se mudar imediatamente apos um desastre enquanto sua casa principal e reconstruida.

RPO: Baixo RTO: Baixo (minutos) Custo: Medio a alto Casos de uso: Sistemas empresariais importantes onde algum tempo de inatividade e aceitavel mas deve ser minimo

 

Active-Active — Dois escritorios completamente operacionais funcionando simultaneamente

Ambas as regioes da AWS lidam simultaneamente com todo o trafego de producao. Se uma regiao cair completamente, a outra absorve todo o trafego instantaneamente sem interrupcao.

Analogia do seguro: Voce tem dois escritorios em cidades diferentes, cada um totalmente equipado com funcionarios e equipamentos identicos. Se o escritorio de Sao Paulo alagar, todos os funcionarios ja estao trabalhando no Rio de Janeiro. Os clientes nunca percebem que algo aconteceu.

RPO: Quase zero RTO: Quase zero (segundos) Custo: O mais alto (infraestrutura identica em duas regioes simultaneamente) Casos de uso: Financas, saude, e-commerce onde ate um minuto de inatividade e inaceitavel

!Comparação de 4 estratégias de recuperação de desastres

Padroes de alta disponibilidade por servico

Entender como cada servico da AWS implementa alta disponibilidade ajuda voce a identificar rapidamente a resposta certa quando o exame pergunta "qual servico voce deveria usar?"

 

EC2 Alta Disponibilidade

Distribua instancias em multiplas Zonas de Disponibilidade (AZs), depois combine com um Auto Scaling Group e um Application Load Balancer (ALB). O padrao essencial de tres pecas: Multi-AZ + Auto Scaling + ALB.

 

RDS Multi-AZ

O RDS Multi-AZ mantem uma instancia primaria e uma instancia standby replicada sincronamente em uma AZ diferente.

Replicacao sincrona: cada escrita e imediatamente aplicada ao standby antes que o primario confirme o sucesso Failover automatico: se o primario falhar, o standby e automaticamente promovido em minutos Distincao importante: Multi-AZ e para alta disponibilidade, NAO para escalar leituras. Use Read Replicas para isso.

 

Aurora Global Database

O Aurora mantem 6 copias de dados em 3 Zonas de Disponibilidade por padrao. Com o Aurora Global Database, voce pode replicar em multiplas regioes da AWS, com regioes secundarias recebendo atualizacoes com latencia inferior a um segundo.

 

DynamoDB Global Tables

Um banco de dados multi-regiao e multi-ativo totalmente gerenciado que suporta leituras e escritas simultaneas de multiplas regioes. Este e o exemplo classico do padrao ativo-ativo.

 

Politicas de roteamento do Route 53

O Route 53 vai alem da simples resolucao de DNS. Ele fornece roteamento inteligente de trafego que desempenha um papel central nas arquiteturas de alta disponibilidade.

| Politica | Quando usar | Palavras-chave do exame | |---------|------------|------------------------| | Failover | Mudar automaticamente para backup quando o primario falha | "failover automatico", "roteamento DR" | | Latency | Rotear usuarios para a regiao com menor latencia | "resposta mais rapida", "minimizar latencia" | | Weighted | Dividir trafego por percentual (ex: 90/10) | "implantacao canary", "teste A/B" | | Geolocation | Rotear com base na localizacao geografica do usuario | "usuarios de um pais especifico", "conformidade regional" | | Geoproximity | Baseado em distancia geografica com bias ajustavel | "mover mais trafego para uma regiao especifica" |

 

Pontos-chave do exame

"Estrategia DR mais barata" -- Backup and Restore

"Apenas o banco de dados central rodando minimamente, ligar o resto rapidamente em caso de falha" -- Pilot Light

"Sistema completo reduzido sempre em execucao, escalar em caso de falha" -- Warm Standby

"RPO/RTO quase zero, estrategia mais cara" -- Active-Active

"RPO = tolerancia a perda de dados, RTO = objetivo de tempo de recuperacao" -- ambos diminuem ao aumentar o custo

Voltar à lista do blog