Pourquoi la surveillance est-elle importante pour un déploiement de production Solana ? Lorsque votre application est sur le réseau principal, de petits délais RPC, des erreurs de nœud ou des anomalies sur la chaîne peuvent entraîner des pannes visibles par les utilisateurs et des lacunes de conformité.
Ce que vous apprendrez : Cette leçon passe en revue les vérifications pratiques de surveillance et de conformité que vous pouvez appliquer à un déploiement sur le réseau principal Solana. Vous apprendrez quelles télémetries collecter (signaux sur la chaîne comme la progression des slots et le nombre de transactions confirmées, et signaux hors chaîne comme la latence RPC, les taux d'erreur, l'I/O CPU et disque), comment combiner ces signaux en alertes significatives, et comment les stratégies de surveillance changent avec différents choix de sélection de réseau (plusieurs RPC publics avec basculement contre un seul fournisseur dédié). La composante pratique vous guide pour produire une configuration de collecte Prometheus, un petit script de vérification de santé en lecture seule qui expose des métriques au format Prometheus, et deux règles d'alerte d'exemple avec des seuils justifiés. Vous créerez également une courte comparaison des approches de surveillance par coût, couverture et surcharge opérationnelle, et définirez un chemin d'escalade et une liste de contrôle pour le reporting d'incidents.
Pour qui est-ce : Développeurs et opérateurs Solana intermédiaires qui ont déjà choisi des points de terminaison RPC et comprennent les compromis de sélection de réseau de base. Une familiarité préalable avec les concepts RPC et les outils d'observabilité de base (Prometheus/Grafana ou équivalent) est recommandée.
Sujets clés abordés :
- Différencier les signaux sur la chaîne (retard de slot, taux de production de blocs, nombre de transactions confirmées) et les signaux hors chaîne (latence RPC, délais d'attente, limites de taux, I/O CPU/disque d'instance)
- Concevoir la télémetrie : quelles métriques collecter à partir des points de terminaison RPC et des modèles d'exportation
- Mettre en œuvre une vérification de santé minimale en lecture seule qui expose des métriques Prometheus
- Configuration de collecte Prometheus d'exemple et règles d'alerte avec justification des seuils
- Comparer les approches de surveillance : Prometheus + Grafana auto-hébergés, observabilité gérée, et alertes des fournisseurs RPC par coût, couverture et surcharge opérationnelle
- Chemins d'escalade et une liste de contrôle de reporting d'incidents d'une page pour les problèmes du réseau principal
Le travail pratique est en lecture seule : vous ne signerez pas de transactions ni ne déplacerez de fonds. Les artefacts de construction incluent une configuration de collecte, un point de terminaison de métriques de vérification de santé, et un tableau de comparaison d'une page à intégrer dans votre liste de contrôle de préparation au déploiement.