7 Fallos Reales de Kubernetes en AWS EKS (Argo CD + Helm) — Diagnostica y Soluciona Como un Ingeniero DevOps
El video demuestra cómo diagnosticar y solucionar siete fallos comunes de Kubernetes en el mundo real a través de nueve microservicios que se ejecutan en AWS EKS y se despliegan mediante Argo CD con gráficos de Helm gestionados a través de un repositorio GitOps en GitHub. El presentador utiliza kubectl y eventos/registros de Argo CD para solucionar problemas como ImagePullBackOff (etiqueta de imagen incorrecta y nombre de repositorio ECR incorrecto), CrashLoopBackOff debido a OOMKilled (código de salida 137 por límites de memoria bajos), pods Pendientes por recursos insuficientes en el clúster (solicitudes de memoria exageradas y alto recuento de réplicas), y servicios atascados en 0/1 debido a fallos en las pruebas de disponibilidad o vivacidad (puertos/rutas incorrectos y tiempos de prueba demasiado agresivos). Un error de plantilla/indentación de Helm que causa un fallo de sincronización de Argo CD impide la creación de pods para un servicio hasta que se corrija. El episodio enfatiza comenzar con la descripción/eventos del pod antes de los registros y solucionar problemas actualizando los valores de Helm en GitOps.
00:00 Visión General de Fallos de Kubernetes
00:47 Arquitectura y Configuración de Argo CD
01:42 Hoja de Trucos de Errores Comunes
03:28 Solucionar ImagePullBackOff Servicio de Autenticación
06:44 Configuración de Sincronización de GitOps y Autosincronización
09:16 Solucionar Imagen de Catálogo y Memoria
14:49 Diagnóstico de Pod Pendiente de Inventario
15:29 Solucionar Límites de Memoria
16:37 Ajustar Recuento de Réplicas
17:06 Sincronizar Cambios en ArgoCD
17:43 Verificar Pod de Inventario
18:30 Fabricación de Puerto de Prueba
22:05 QC Ruta de Vivacidad
24:03 Ajustar Tiempos de Prueba de QC
25:47 Solución de Notificación de Disponibilidad
27:28 Sintaxis de Helm del Proveedor
29:49 Conclusión de Solución de Problemas