7 échecs Kubernetes dans le monde réel sur AWS EKS (Argo CD + Helm) — Diagnostiquer et réparer comme un ingénieur DevOps
La vidéo démontre le diagnostic et la réparation de sept échecs Kubernetes courants dans le monde réel à travers neuf microservices fonctionnant sur AWS EKS et déployés via Argo CD avec des charts Helm gérés à travers un dépôt GitOps sur GitHub. Le présentateur utilise kubectl et les événements/logs d'Argo CD pour résoudre des problèmes tels que ImagePullBackOff (mauvaise balise d'image et nom de dépôt ECR incorrect), CrashLoopBackOff dû à OOMKilled (code de sortie 137 en raison de limites de mémoire faibles), des pods en attente à cause de ressources de cluster insuffisantes (demandes de mémoire surestimées et nombre de réplicas élevé), et des services bloqués à 0/1 en raison d'échecs des probes de readiness ou de liveness (ports/chemins incorrects et timings de probes trop agressifs). Une erreur de modèle d'Helm/indentation causant un échec de synchronisation d'Argo CD empêche la création de pods pour un service jusqu'à ce qu'elle soit corrigée. L'épisode souligne l'importance de commencer par décrire les pods/événements avant les logs et de résoudre les problèmes en mettant à jour les valeurs Helm dans GitOps.
00:00 Aperçu des échecs Kubernetes
00:47 Architecture et configuration d'Argo CD
01:42 Fiche de triche des erreurs courantes
03:28 Réparer ImagePullBackOff Service d'authentification
06:44 Synchronisation GitOps et paramètres d'autosynchronisation
09:16 Réparer l'image du catalogue et la mémoire
14:49 Diagnostic des pods en attente d'inventaire
15:29 Réparer les limites de mémoire
16:37 Ajuster le nombre de réplicas
17:06 Synchroniser les modifications ArgoCD
17:43 Vérifier le pod d'inventaire
18:30 Fabrication du port de probe
22:05 QC du chemin de liveness
24:03 Ajuster les timings de probe QC
25:47 Correction de la notification de readiness
27:28 Syntaxe Helm du fournisseur
29:49 Conclusion du dépannage