Bienvenue à la session 4 du Bootcamp SRE !
Dans cette session pratique, nous allons au-delà des bases de l'observabilité et plongeons dans la manière dont les ingénieurs en fiabilité des sites surveillent les systèmes de production, écrivent des requêtes PromQL, configurent des alertes et visualisent des métriques à l'aide de Grafana.
Cette session comprend des démonstrations pratiques utilisant un environnement de laboratoire basé sur Docker avec Prometheus et Grafana, ce qui la rend idéale pour quiconque se prépare à des rôles en SRE, DevOps, ingénierie de plateforme ou ingénierie cloud.
Sujets abordés
✅ Revue de l'infrastructure du laboratoire de surveillance
✅ Compréhension de la configuration de surveillance basée sur Docker
✅ Configuration de Prometheus pour collecter des métriques
✅ Introduction à PromQL
✅ Écriture de requêtes PromQL pour :
- Taux d'erreur
- Volume de requêtes
- Latence (P99)
- Objectifs de niveau de service (SLO)
✅ Découverte de services dans des environnements de production
✅ Pourquoi la configuration manuelle des cibles ne s'échelonne pas
✅ Création de tableaux de bord Grafana
✅ Connexion de Prometheus en tant que source de données
✅ Création de visualisations à l'aide de PromQL
✅ Simulation d'incidents de production à l'aide de l'ingénierie de chaos
✅ Observation des alertes en temps réel et des changements de métriques
✅ Configuration des règles d'alerte et des points de contact
✅ Flux de travail d'alerte et gestion des incidents
Qui devrait regarder ?
- Ingénieurs logiciels
- Ingénieurs en fiabilité des sites (SRE)
- Ingénieurs DevOps
- Ingénieurs de plateforme
- Ingénieurs cloud
- Étudiants préparant des entretiens backend et infrastructure
À la fin de cette session, vous comprendrez comment les équipes d'ingénierie modernes surveillent les applications, détectent les pannes, configurent des alertes et construisent des tableaux de bord utilisés dans de véritables environnements de production.
Si vous avez trouvé cette vidéo utile, n'oubliez pas de Liker, de vous Abonner et de Partager. D'autres sessions du Bootcamp SRE couvrant Kubernetes, Linux, Réseautique, CI/CD, Gestion des incidents, Infrastructure cloud et Débogage en production arrivent bientôt !
#SRE #IngénierieFiabilitéDesSites #DevOps #Prometheus #Grafana #PromQL #Observabilité #Surveillance #Alertes #InformatiqueCloud #Kubernetes #IngénierieBackend #SystèmesDistribués #IngénierieLogicielle #CodeKerdos