¿Por qué es importante el monitoreo para un despliegue de producción en Solana? Cuando tu aplicación está en mainnet, pequeños retrasos en RPC, errores de nodo o anomalías en la cadena pueden desencadenar interrupciones visibles para el usuario y brechas de cumplimiento.
Lo que aprenderás: Esta lección repasa controles prácticos de monitoreo y cumplimiento que puedes aplicar a un despliegue en Solana mainnet. Aprenderás qué telemetría recolectar (señales en cadena como el progreso de slots y el conteo de transacciones confirmadas, y señales fuera de cadena como la latencia de RPC, tasas de error, I/O de CPU y disco), cómo combinar esas señales en alertas significativas, y cómo las estrategias de monitoreo cambian con diferentes elecciones de selección de red (múltiples RPC públicos con failover versus un único proveedor dedicado). El componente práctico te guiará para producir una configuración de scrape de Prometheus, un pequeño script de verificación de salud de solo lectura que expone métricas en formato Prometheus, y dos reglas de alerta de ejemplo con umbrales justificados. También crearás una breve comparación de enfoques de monitoreo por costo, cobertura y carga operativa, y definirás un camino de escalación y una lista de verificación para informes de incidentes.
Para quién es esto: Desarrolladores y operadores intermedios de Solana que ya han elegido puntos finales de RPC y entienden las compensaciones básicas de selección de red. Se recomienda tener familiaridad previa con conceptos de RPC y herramientas básicas de observabilidad (Prometheus/Grafana o equivalente).
Temas clave cubiertos:
- Diferenciación de señales en cadena (retraso de slots, tasa de producción de bloques, conteo de transacciones confirmadas) y señales fuera de cadena (latencia de RPC, tiempos de espera, límites de tasa, I/O de CPU/disk)
- Diseño de telemetría: qué métricas recolectar de los puntos finales de RPC y patrones de exportador
- Implementación de una verificación de salud mínima de solo lectura que expone métricas de Prometheus
- Ejemplo de configuración de scrape de Prometheus y reglas de alerta con justificación de umbrales
- Comparación de enfoques de monitoreo: Prometheus + Grafana autohospedados, observabilidad gestionada y alertas de proveedores de RPC por costo, cobertura y carga operativa
- Caminos de escalación y una lista de verificación de informes de incidentes de una página para problemas en mainnet
El trabajo práctico es de solo lectura: no firmarás transacciones ni moverás fondos. Los artefactos de construcción incluyen una configuración de scrape, un punto final de métricas de verificación de salud y una tabla de comparación de una página para alimentar tu lista de verificación de preparación para el despliegue.