¡Bienvenido a la Sesión 4 del Bootcamp de SRE!
En esta sesión práctica, vamos más allá de los conceptos básicos de la observabilidad y profundizamos en cómo los Ingenieros de Confiabilidad del Sitio monitorean sistemas de producción, escriben consultas PromQL, configuran alertas y visualizan métricas utilizando Grafana.
Esta sesión incluye demostraciones prácticas utilizando un entorno de laboratorio basado en Docker con Prometheus y Grafana, lo que la hace ideal para cualquier persona que se esté preparando para roles en SRE, DevOps, Ingeniería de Plataformas o Ingeniería en la Nube.
Temas Cubiertos
✅ Revisión de la infraestructura del laboratorio de monitoreo
✅ Comprensión de la configuración de monitoreo basada en Docker
✅ Configuración de Prometheus para recopilar métricas
✅ Introducción a PromQL
✅ Escribiendo consultas PromQL para:
- Tasa de Errores
- Volumen de Solicitudes
- Latencia (P99)
- Objetivos de Nivel de Servicio (SLOs)
✅ Descubrimiento de Servicios en entornos de producción
✅ Por qué la configuración manual de objetivos no escala
✅ Creación de paneles en Grafana
✅ Conectando Prometheus como fuente de datos
✅ Construyendo visualizaciones utilizando PromQL
✅ Simulando incidentes de producción utilizando ingeniería del caos
✅ Observando alertas en tiempo real y cambios en métricas
✅ Configuración de reglas de alerta y puntos de contacto
✅ Flujo de trabajo de alertas y gestión de incidentes
¿Quién Debería Verlo?
- Ingenieros de Software
- Ingenieros de Confiabilidad del Sitio (SRE)
- Ingenieros de DevOps
- Ingenieros de Plataformas
- Ingenieros en la Nube
- Estudiantes preparándose para entrevistas de backend e infraestructura
Al final de esta sesión, entenderás cómo los equipos de ingeniería modernos monitorean aplicaciones, detectan fallos, configuran alertas y construyen paneles que se utilizan en entornos de producción reales.
Si encontraste útil este video, no olvides dar Me gusta, Suscribirte y Compartir. ¡Pronto llegarán más sesiones del Bootcamp de SRE que cubrirán Kubernetes, Linux, Redes, CI/CD, Gestión de Incidentes, Infraestructura en la Nube y Depuración en Producción!
#SRE #IngenieríaDeConfiabilidadDelSitio #DevOps #Prometheus #Grafana #PromQL #Observabilidad #Monitoreo #Alertas #ComputaciónEnLaNube #Kubernetes #IngenieríaBackend #SistemasDistribuidos #IngenieríaDeSoftware #CodeKerdos