장애 대응 가이드
먼저 확인할 신호, 명령 예시, 흔한 오진, 복구 순서를 정리했습니다. 읽은 뒤 같은 장애를 다룬 문제로 바로 연습할 수 있습니다.
CrashLoopBackOff가 뜰 때 가장 먼저 볼 것Pod가 반복 재시작하면서 이전 로그와 event에 실제 원인이 남는 상황Kubernetes5분 읽기ImagePullBackOff에서 먼저 확인할 registry와 Secret이미지 이름은 맞아 보이지만 tag, registry credential, network policy 때문에 pull이 실패하는 상황Kubernetes4분 읽기ImagePullBackOff root cause를 분리하는 법registry 인증, tag drift, node egress, mirror policy가 같은 오류처럼 보이는 상황Kubernetes3분 읽기Pod는 Running인데 Service traffic만 실패하는 경우Pod 상태는 정상으로 보이지만 Service, Endpoint, NetworkPolicy, Ingress 경로가 끊긴 상황Kubernetes3분 읽기CoreDNS는 Running인데 DNS 조회만 실패할 때CoreDNS Pod는 정상처럼 보이지만 kube-dns 경로, upstream, node-local-dns, policy에서 실패하는 상황Kubernetes3분 읽기Helm values merge와 환경 override drift 점검법GitOps sync는 성공했지만 실제 rendered manifest와 기대 설정이 다른 상황Kubernetes2분 읽기ConfigMap은 바뀌었는데 Pod가 이전 값을 계속 쓸 때ConfigMap 업데이트 이후 envFrom, subPath, volume projection, rollout trigger 차이로 값이 갱신되지 않는 상황Kubernetes3분 읽기Kubernetes 장애를 Pod, Service, rollout 경계로 나누는 법Kubernetes 장애가 Pod 상태, Service discovery, controller, storage, network 중 어디에서 시작됐는지 분리해야 하는 상황Kubernetes2분 읽기GPU 노드는 있는데 워크로드는 계속 스케줄되지 않을 때GPU node는 보이는데 Pod만 계속 Pending일 때, resource request, taint/toleration, node selector, driver 준비 상태를 먼저 분리하는 가이드입니다.Kubernetes4분 읽기PersistentVolume은 다시 붙는데 롤아웃은 계속 멈출 때볼륨 attach는 된 것처럼 보이는데 Pod replacement와 rollout만 계속 멈출 때, attach 상태와 workload readiness를 분리해서 보는 가이드입니다.Kubernetes4분 읽기