O exame AZ-400 não pergunta apenas se um serviço está ativo — avalia se você sabe como descobrir por que ele se comporta de determinada maneira. O foco está no design de observabilidade com três pilares: métricas, logs e traces. Este artigo explica como Azure Monitor, Application Insights e Log Analytics desempenham papéis distintos, e como KQL, SLO e as métricas DORA completam o panorama.
Monitoramento vs. Observabilidade
Imagine a tela de monitoramento de uma UTI hospitalar. Quando a pressão arterial de um paciente sai do intervalo normal, um alarme soa. Isso é monitoramento. Agora imagine o médico perguntando: "Como este paciente chegou a este estado?" Responder exige cruzar 72 horas de registros de medicação e tendências de exames de sangue. Isso é observabilidade.
Sistemas de software funcionam da mesma forma. O monitoramento detecta modos de falha conhecidos. A observabilidade permite raciocinar sobre falhas desconhecidas a partir do estado interno do sistema. A base são três tipos de sinais.
: Resumos numéricos ao longo do tempo — uso de CPU, contagem de requisições, latência. Rápidas de consultar, ideais para alertas de estado atual. : Registros do que aconteceu em um momento específico. Sem estrutura fixa, mas com grande riqueza de contexto. : A jornada de uma única requisição por múltiplos serviços. Responde "por que esta requisição levou 3 segundos?"
No Azure, a plataforma que unifica os três sinais é o Azure Monitor.
!Monitoramento vs observabilidade
Arquitetura do Azure Monitor
Pense no painel de instrumentos de um carro moderno. Velocímetro, indicador de combustível e luzes de advertência aparecem em um único lugar — o motorista não precisa abrir aplicativos separados de cada fabricante. O Azure Monitor desempenha exatamente esse papel para os recursos do Azure.
Metrics e Logs
O Azure Monitor Metrics armazena dados de séries temporais por 93 dias. Métricas de plataforma como CPU de VM, transações de Storage Account e requisições HTTP de App Service são coletadas automaticamente. Você pode visualizá-las no Metrics Explorer ou conectá-las como fontes de sinal para regras de Alert.
O Azure Monitor Logs armazena dados em um workspace do Log Analytics. Ao habilitar Diagnostic Settings nos recursos do Azure, os logs são encaminhados para o workspace, onde KQL (Kusto Query Language) permite analisá-los livremente.
O KQL lembra o SQL, mas usa uma estrutura de pipe que torna as transformações fáceis de ler. O Azure Workbooks combina consultas KQL, gráficos de métricas e texto em uma única página interativa — útil para relatórios de SLA e revisões pós-incidente compartilhadas com a equipe.
Application Insights — Rastreamento Distribuído
Imagine o sistema de rastreamento de bagagem de um aeroporto. Cada mala recebe um código de barras no check-in, e cada leitura fica registrada. Se uma mala se perde, você encontra imediatamente o último ponto de controle. O rastreamento distribuído do Application Insights funciona da mesma forma para requisições HTTP.
Mapas de Dependências e Live Metrics
Em uma arquitetura de microsserviços, uma requisição HTTP pode percorrer API Gateway → Order Service → Inventory Service → Banco de Dados. O Application Insights atribui o mesmo a cada salto, vinculando toda a jornada em um único trace. O Application Map exibe isso como um grafo visual com taxas de falha e tempos de resposta para cada chamada entre serviços.
Registrar cada requisição em um serviço de alto tráfego pode disparar os custos. O Adaptive Sampling limita automaticamente a coleta a aproximadamente 5 operações por segundo. Quando você precisa de diagnóstico em tempo real, o Live Metrics Stream permite observar o estado atual com latência praticamente zero.
Mesmo sem alertas configurados manualmente, o Smart Detection aprende uma linha de base de desempenho e detecta anomalias automaticamente — aumentos de tempo de resposta, picos de falhas, degradação de dependências — sem necessidade de configuração de limites.
Regras de Alerta e Action Groups
Pense em um sistema automático de notificação de incêndios. O detector dispara um sinal, o painel encaminha para o corpo de bombeiros, e os caminhões saem — sem humanos no ciclo entre detecção e resposta. As regras de Alert do Azure Monitor combinadas com Action Groups constroem exatamente essa estrutura.
Uma regra de Alert tem três partes. seleciona o que monitorar: valores de Metrics, resultados de consultas do Log Analytics ou eventos do Activity Log. define quando disparar: limite excedido, contagem de linhas em consulta ou mudança de estado. define o que acontece: e-mail, SMS, invocação de Azure Function, acionador de Logic App ou integração com ITSM.
O tráfego é alto durante o horário comercial e baixo à noite. Limites fixos produzem falsos positivos noturnos ou perdem anomalias nos horários de pico. Dynamic Thresholds aprende padrões históricos e ajusta o intervalo normal por hora do dia automaticamente, reduzindo a fadiga de alertas sem perder sensibilidade.
SLO, SLI, Error Budget e Métricas DORA
Se uma equipe declara "nosso serviço garante 99,9% de disponibilidade", como verificam que essa promessa está sendo cumprida? Assim como uma equipe de vendas acompanha resultados semanais frente a uma meta trimestral, as equipes de engenharia precisam rastrear a confiabilidade quantitativamente.
Um SLI (Service Level Indicator) é a medição — "percentual de respostas bem-sucedidas nos últimos 30 dias." Um SLO (Service Level Objective) é a meta: "99,9% ou mais." Você calcula SLIs diretamente no Log Analytics com KQL. Um SLO de 99,9% permite aproximadamente 43 minutos de inatividade por mês — essa margem é o Error Budget. Quando esgotado, a prática SRE indica pausar lançamentos de novos recursos e focar em melhorias de confiabilidade.
As métricas DORA (DevOps Research and Assessment) medem a saúde do processo de entrega. As equipes conectam o Log Analytics com dados de pipelines do Azure DevOps para rastrear quatro indicadores: Deployment Frequency, Lead Time for Changes, Change Failure Rate e MTTR (Mean Time to Restore).
Resumo do Exame
As perguntas de monitoramento do AZ-400 focam em qual ferramenta resolve qual problema.
"Rastrear uma requisição através de múltiplos serviços" -- Application Insights rastreamento distribuído + Application Map "Armazenar e visualizar séries temporais de métricas de plataforma" -- Azure Monitor Metrics + Metrics Explorer "Consultar logs para encontrar padrões de erro" -- Log Analytics + KQL "Detectar anomalias automaticamente sem configurar limites" -- Application Insights Smart Detection "Invocar uma Azure Function quando um alerta é disparado" -- Action Groups (destino Azure Function) "Considerar diferenças de tráfego dia/noite em alertas" -- Dynamic Thresholds "Calcular SLI e rastrear Error Budget" -- Consultas KQL no Log Analytics "Métrica DORA para tempo de recuperação" -- MTTR (integração Azure DevOps + Log Analytics) "Visualizar latência entre serviços dependentes" -- Application Insights Application Map "Relatórios de monitoramento interativos compartilháveis para a equipe" -- Azure Monitor Workbooks
Azure Monitor = hub para todas as métricas e logs da plataforma, Application Insights = rastreamento distribuído e Smart Detection, Log Analytics + KQL = mecanismo de consulta que une todos os dados.