7 Falhas Reais do Kubernetes no AWS EKS (Argo CD + Helm) — Diagnostique e Corrija Como um Engenheiro de DevOps
O vídeo demonstra como diagnosticar e corrigir sete falhas comuns do Kubernetes em ambientes reais, em nove microserviços rodando no AWS EKS e implantados via Argo CD com gráficos Helm gerenciados através de um repositório GitOps no GitHub. O apresentador utiliza kubectl e eventos/logs do Argo CD para solucionar problemas como ImagePullBackOff (tag de imagem errada e nome de repositório ECR incorreto), CrashLoopBackOff devido a OOMKilled (código de saída 137 por limites de memória baixos), pods Pending devido a recursos insuficientes no cluster (solicitações de memória exageradas e alta contagem de réplicas), e serviços presos em 0/1 devido a falhas em probes de readiness ou liveness (portas/caminhos errados e tempos de probe excessivamente agressivos). Um erro de template/indentação do Helm que causa falha de sincronização do Argo CD impede a criação de pods para um serviço até ser corrigido. O episódio enfatiza começar com a descrição/eventos do pod antes dos logs e corrigir problemas atualizando os valores do Helm no GitOps.
00:00 Visão Geral das Falhas do Kubernetes
00:47 Arquitetura e Configuração do Argo CD
01:42 Folha de Dicas de Erros Comuns
03:28 Corrigir ImagePullBackOff do Serviço de Autenticação
06:44 Configurações de Sincronização do GitOps e Autosync
09:16 Corrigir Imagem do Catálogo e Memória
14:49 Diagnóstico de Pod Pending do Inventário
15:29 Corrigir Limites de Memória
16:37 Ajustar Contagem de Réplicas
17:06 Sincronizar Alterações no ArgoCD
17:43 Verificar Pod do Inventário
18:30 Fabricar Porta de Probe
22:05 QC Caminho de Liveness
24:03 Ajustar Tempos de Probe do QC
25:47 Correção de Readiness de Notificação
27:28 Sintaxe do Helm do Fornecedor
29:49 Conclusão da Solução de Problemas