Willkommen zur Sitzung 4 des SRE Bootcamps!
In dieser praktischen Sitzung gehen wir über die Grundlagen der Beobachtbarkeit hinaus und tauchen ein in die Methoden, wie Site Reliability Engineers Produktionssysteme überwachen, PromQL-Abfragen schreiben, Alarme konfigurieren und Metriken mit Grafana visualisieren.
Diese Sitzung umfasst praktische Demonstrationen in einer Docker-basierten Laborumgebung mit Prometheus und Grafana, was sie ideal für alle macht, die sich auf Rollen in SRE, DevOps, Platform Engineering oder Cloud Engineering vorbereiten.
Behandelte Themen
✅ Überprüfung der Überwachungs-Lab Infrastruktur
✅ Verständnis des Docker-basierten Überwachungs-Setups
✅ Konfiguration von Prometheus zum Abrufen von Metriken
✅ Einführung in PromQL
✅ Schreiben von PromQL-Abfragen für:
- Fehlerquote
- Anforderungsvolumen
- Latenz (P99)
- Service Level Objectives (SLOs)
✅ Service Discovery in Produktionsumgebungen
✅ Warum manuelle Zielkonfiguration nicht skalierbar ist
✅ Erstellung von Grafana-Dashboards
✅ Verbindung von Prometheus als Datenquelle
✅ Erstellung von Visualisierungen mit PromQL
✅ Simulation von Produktionsvorfällen mit Chaos Engineering
✅ Beobachtung von Echtzeit-Alarme und Metrikänderungen
✅ Konfiguration von Alarmregeln und Kontaktpunkten
✅ Alarmierungsworkflow und Vorfallmanagement
Wer sollte zuschauen?
- Software-Ingenieure
- Site Reliability Engineers (SRE)
- DevOps-Ingenieure
- Platform Engineers
- Cloud Engineers
- Studenten, die sich auf Backend- und Infrastruktur-Interviews vorbereiten
Am Ende dieser Sitzung wirst du verstehen, wie moderne Ingenieurteams Anwendungen überwachen, Fehler erkennen, Alarme konfigurieren und Dashboards erstellen, die in echten Produktionsumgebungen verwendet werden.
Wenn du dieses Video hilfreich fandest, vergiss nicht, zu liken, zu abonnieren und zu teilen. Weitere SRE Bootcamp-Sitzungen zu Kubernetes, Linux, Networking, CI/CD, Incident Management, Cloud-Infrastruktur und Produktions-Debugging kommen bald!