Bem-vindo à Sessão 4 do Bootcamp SRE!
Nesta sessão prática, vamos além do básico da observabilidade e mergulhamos em como os Engenheiros de Confiabilidade de Site monitoram sistemas de produção, escrevem consultas PromQL, configuram alertas e visualizam métricas usando o Grafana.
Esta sessão inclui demonstrações práticas usando um ambiente de laboratório baseado em Docker com Prometheus e Grafana, tornando-a ideal para quem está se preparando para funções de SRE, DevOps, Engenharia de Plataforma ou Engenharia de Nuvem.
Tópicos Abordados
✅ Revisão da infraestrutura do laboratório de monitoramento
✅ Compreensão da configuração de monitoramento baseada em Docker
✅ Configurando o Prometheus para coletar métricas
✅ Introdução ao PromQL
✅ Escrevendo consultas PromQL para:
- Taxa de Erros
- Volume de Requisições
- Latência (P99)
- Objetivos de Nível de Serviço (SLOs)
✅ Descoberta de Serviços em ambientes de produção
✅ Por que a configuração manual de alvos não escala
✅ Criação de dashboards no Grafana
✅ Conectando o Prometheus como fonte de dados
✅ Construindo visualizações usando PromQL
✅ Simulando incidentes de produção usando engenharia de caos
✅ Observando alertas em tempo real e mudanças nas métricas
✅ Configurando regras de alerta e pontos de contato
✅ Fluxo de trabalho de alertas e gerenciamento de incidentes
Quem Deve Assistir?
- Engenheiros de Software
- Engenheiros de Confiabilidade de Site (SRE)
- Engenheiros DevOps
- Engenheiros de Plataforma
- Engenheiros de Nuvem
- Estudantes se preparando para entrevistas de backend e infraestrutura
Ao final desta sessão, você entenderá como as equipes de engenharia modernas monitoram aplicações, detectam falhas, configuram alertas e constroem dashboards que são usados em ambientes de produção reais.
Se você achou este vídeo útil, não se esqueça de Curtir, Inscrever-se e Compartilhar. Mais sessões do Bootcamp SRE cobrindo Kubernetes, Linux, Redes, CI/CD, Gerenciamento de Incidentes, Infraestrutura de Nuvem e Depuração de Produção estão a caminho!