Kubernetes
Kubernetes 환경에서 일어나는 장애 문제 586개를 모았습니다.
먼저 읽을 가이드
추천 문제
모든 문제 586개
K8S-1413cluster autoscaler 확장은 맞아 보이는데 pending pod가 계속 스케줄되지 않음EKS에서 노드 그룹을 롤백한 뒤 확장 이벤트는 일어나는데 대상 워크로드가 계속 pending입니다.Kubernetes고급14분ProK8S-1423cluster autoscaler가 노드를 늘려도 pending pod가 계속 스케줄되지 않음autoscaler를 섞어 이전한 결과, 확장 이벤트는 성공하는데 정작 의도한 워크로드가 배치되지 않습니다.Kubernetes고급14분ProK8S-1433확장 이벤트로 노드가 늘어도 pending pod가 계속 스케줄되지 않음노드 풀 이전 후 확장은 기계적으로 되는데 대상 워크로드가 계속 pending입니다.Kubernetes고급14분ProK8S-1443확장이 pending pod가 들어갈 거라고 하는데 계속 스케줄되지 않음노드 풀 이전이 끝났는데 대상 워크로드가 계속 pending입니다.Kubernetes고급14분ProK8S-1349Cilium Hubble flow 뷰는 허용으로 보이는데 앱이 계속 실패운영자가 Hubble로 연결 문제를 조사하다가, 보이던 pod 흐름이 정작 버림이 일어나는 구간이 아니었음을 발견합니다.Kubernetes고급15분ProK8S-1361Cilium 롤아웃 후 네임스페이스 하나가 도달 불가플랫폼 팀이 label을 표준화한 뒤 일부 노드에서만 네임스페이스 하나가 east-west 트래픽을 잃습니다.Kubernetes고급15분ProK8S-1371Cilium 업그레이드 후 네임스페이스 하나가 도달 불가label 정리를 배포한 뒤 일부 노드에서만 네임스페이스 하나가 트래픽을 잃습니다.Kubernetes고급15분ProK8S-1327DaemonSet은 정상으로 보이는데 노드 계열 하나가 끝내 에이전트를 못 받음fleet에 새 노드 풀 이미지를 추가한 뒤, 다른 곳에서는 정상인 DaemonSet 하나가 그 노드들을 조용히 건너뜁니다.Kubernetes고급15분ProK8S-1335EKS 워크로드는 AWS API에 닿는데 secret 조회 하나가 계속 실패다중 클러스터 플랫폼이 secret 동기화 방식을 하나로 표준화했는데, EKS 클러스터 계열 하나만 AWS 기반 secret 조회에 실패합니다.Kubernetes고급15분ProK8S-1402Gatekeeper 정책 롤아웃이 대부분의 요청에서 동작하는데 API 서버 하나가 금지된 객체를 계속 허용로드밸런싱되는 API 엔드포인트 뒤에서, 금지된 manifest가 한 kubectl 클라이언트에서는 거부되고 다른 쪽에서는 받아들여집니다.Kubernetes고급15분ProK8S-1392Gatekeeper 정책은 그대로인데 네임스페이스 하나가 admission에서 실패하기 시작컨트롤 플레인 업그레이드 후 같은 리소스 종류인데 admission 경로에 따라 정책 동작이 달라집니다.Kubernetes고급15분ProK8S-1347kube-proxy IPVS 이전은 통과하는데 서비스 하나가 트래픽을 블랙홀네트워킹 최적화 배포가 정상으로 보이는데, 이후 노드 하나가 간헐적 서비스 트래픽 손실의 원인이 됩니다.Kubernetes고급15분ProK8S-1367kube-proxy IPVS 이전이 대체로 잘 되는데 노드 하나가 서비스 트래픽을 블랙홀클러스터 네트워킹 최적화를 배포했고 이전도 성공으로 보고됐는데, 이후 노드 하나에서만 간헐적으로 서비스 트래픽이 끊깁니다.Kubernetes고급15분ProK8S-1377kube-proxy IPVS 이전이 대체로 잘 되는데 노드 하나가 서비스 트래픽을 블랙홀네트워크 최적화 배포가 끝난 뒤 노드 하나에서만 간헐적으로 서비스 트래픽이 끊깁니다.Kubernetes고급15분ProK8S-1399kube-proxy 대체 이전이 worker 노드에서는 되는데 컨트롤 플레인에 있는 daemonset 하나가 서비스 도달성을 잃음데이터플레인 이전으로 pod 트래픽은 좋아졌는데, 컨트롤 플레인 노드의 host-network 에이전트만 서비스 조회나 접근에 실패합니다.Kubernetes고급15분ProK8S-1357kubeadm worker join은 통과하는데 pod가 이미지를 pull하지 못함사설 mirror로 이전한 뒤 컨트롤 플레인 노드는 정상인데 새로 합류한 worker에서만 pod가 시작하지 못합니다.Kubernetes고급15분ProK8S-1345kubelet 인증서 rotation은 성공했는데 노드가 계속 NotReady로 뒤집힘인증서 점검 창이 끝난 뒤 kubelet rotation은 성공했는데도 노드 readiness나 메트릭이 일관되지 않습니다.Kubernetes고급15분ProK8S-1339Kubernetes ingress 뒤의 OpenSearch 클러스터는 정상으로 보이는데 dashboards 로그인 하나가 계속 끊김관측 스택을 ingress로 노출했는데, ingress 튜닝을 바꾼 뒤 대시보드 로그인만 계속 맴돕니다.Kubernetes고급15분ProK8S-1355Kubernetes의 OpenSearch 클러스터가 yellow에 머무름zone label 이전을 배포했는데, 클러스터에 노드가 충분한데도 stateful 검색 레플리카가 계속 Pending입니다.Kubernetes고급15분ProK8S-1323label 정리 후 HPA에 메트릭이 보이지 않음플랫폼 팀이 label을 표준화한 뒤, 뒷단 모니터링 질의는 데이터를 반환하는데 HPA가 메트릭을 보지 못합니다.Kubernetes고급15분Pro