7 reale Kubernetes-Fehler auf AWS EKS (Argo CD + Helm) – Diagnostizieren und Beheben wie ein DevOps-Ingenieur
Das Video zeigt, wie man sieben häufige reale Kubernetes-Fehler in neun Microservices, die auf AWS EKS laufen und über Argo CD mit Helm-Charts aus einem GitOps GitHub-Repo bereitgestellt werden, diagnostiziert und behebt. Der Präsentator verwendet kubectl und Argo CD-Ereignisse/-Protokolle, um Probleme wie ImagePullBackOff (falsches Image-Tag und falscher ECR-Repository-Name), CrashLoopBackOff aufgrund von OOMKilled (Exit-Code 137 wegen niedriger Speicherkapazitäten), wartende Pods aufgrund unzureichender Cluster-Ressourcen (überhöhte Speicheranforderungen und hohe Replikationsanzahl) und Dienste, die bei 0/1 stecken bleiben, weil die Readiness- oder Liveness-Probes fehlschlagen (falsche Ports/Pfade und zu aggressive Probe-Zeiten) zu beheben. Ein Helm-Template/Einrückungsfehler, der einen Argo CD-Synchronisierungsfehler verursacht, verhindert die Erstellung von Pods für einen Dienst, bis er korrigiert wird. Die Episode betont, dass man mit Pod-Beschreibungen/Ereignissen beginnen sollte, bevor man Protokolle betrachtet, und Probleme durch Aktualisierung der Helm-Werte in GitOps behebt.
00:00 Übersicht über Kubernetes-Fehler
00:47 Architektur und Argo CD-Setup
01:42 Häufige Fehler-Checkliste
03:28 ImagePullBackOff Auth-Service beheben
06:44 GitOps-Synchronisierung und Autosync-Einstellungen
09:16 Katalog-Image und Speicher beheben
14:49 Diagnose wartender Inventar-Pods
15:29 Speichergrenzen beheben
16:37 Replikationsanzahl anpassen
17:06 Änderungen in ArgoCD synchronisieren
17:43 Inventar-Pod überprüfen
18:30 Herstellungs-Probe-Port
22:05 QC Liveness-Pfad
24:03 QC-Probe-Zeiten anpassen
25:47 Benachrichtigung zur Readiness beheben
27:28 Lieferanten Helm-Syntax
29:49 Zusammenfassung der Fehlersuche