벤더문제 586개· 검수 문제 4개

Kubernetes

Kubernetes 환경에서 일어나는 장애 문제 586개를 모았습니다.

모든 문제 586개

K8S-1365OpenSearch StatefulSet의 레플리카 하나가 Pending에 머무름label 이전이 끝난 뒤, 클러스터 용량은 있어 보이는데 검색 레플리카 하나가 계속 스케줄되지 못합니다.Kubernetes고급15분ProK8S-1375OpenSearch StatefulSet의 레플리카 하나가 Pending에 머무름zone label 이전이 끝났는데, zone별 노드가 충분한데도 검색 레플리카 하나가 계속 Pending입니다.Kubernetes고급15분ProK8S-1395OpenSearch 오퍼레이터 롤아웃은 정상으로 보이는데 shard 할당이 계속 요동zone 정규화 정리가 끝났는데, 노드 label이 맞고 노드도 정상인데 shard가 계속 튕겨 다닙니다.Kubernetes고급15분ProK8S-1343OpenSearch 오퍼레이터 롤아웃이 pod를 영원히 재시작차트 이름 변경이 무해해 보였는데 커스텀 리소스 하나가 admission·검증 오류로 계속 reconcile에 실패합니다.Kubernetes고급15분ProK8S-1325projected 서비스 계정 토큰은 유효해 보이는데 커스텀 API aggregation 계층이 계속 거부플랫폼이 토큰 audience를 좁힌 뒤, 코어 API 서버에는 잘 되는 pod에서 확장 API 하나만 인증 실패를 반환하기 시작합니다.Kubernetes고급15분ProK8S-1359PVC 스냅샷 복원이 끝난 것으로 보이는데 앱이 계속 쓰기를 망가뜨림재해 복구가 성공한 것으로 보이는데, 복원된 스냅샷 계보가 의도한 것이 아니라 애플리케이션이 예상 밖의 과거 상태를 보여 줍니다.Kubernetes고급15분ProK8S-1384Rancher 관리 클러스터 업그레이드는 끝났는데 노드 풀 하나가 끝내 재합류하지 못함관리형 클러스터 업그레이드가 대체로 성공한 듯한데 노드 풀 하나가 관리 플레인과 끊긴 채로 남습니다.Kubernetes고급15분ProK8S-1363webhook 인증서는 유효한데 admission이 계속 타임아웃팀이 테스트 pod로 webhook을 검증했는데, 정책 강화 변경 후 여전히 admission 타임아웃이 발생합니다.Kubernetes고급15분ProK8S-1373webhook 인증서는 유효한데 admission이 계속 타임아웃워크로드 probe에서는 webhook이 정상으로 보이는데, 네트워크 정책 강화 후 모든 admission 요청이 계속 실패합니다.Kubernetes고급15분ProK8S-1317네임스페이스 이전 후 HPA가 유휴로 보임워크로드를 새 네임스페이스로 깔끔히 옮겼는데, 대시보드에는 활동이 보이면서 오토스케일링만 반응을 멈춥니다.Kubernetes고급15분ProK8S-1353로그 급증 후 kubelet 축출 폭풍이 시작운영자가 노드 디스크 대시보드를 신뢰하는데, 이미지 pull이 몰리거나 로그가 늘면 예상 밖의 pod 축출이 발생합니다.Kubernetes고급15분ProK8S-1385로컬 PV를 쓰는 StatefulSet의 pod 하나가 계속 Pending노드 교체 후 클러스터 label을 정리했는데 로컬 저장소에 여유가 있는데도 StatefulSet pod 하나가 Pending에 머무릅니다.Kubernetes고급15분ProK8S-1389서비스 메시 egress 게이트웨이는 정상으로 보이는데 아웃바운드 TLS가 계속 실패mesh trust 교체가 스테이징에서는 성공했는데, 운영 네임스페이스 하나만 egress 게이트웨이로 외부 TLS 목적지에 닿지 못합니다.Kubernetes고급15분ProK8S-1321admission webhook이 올바른 인증서를 제시하는데도 계속 타임아웃테스트 pod에서는 webhook이 정상으로 보이는데, 네트워크 정책이나 DNS를 고친 뒤에도 모든 admission 요청이 계속 실패합니다.Kubernetes고급16분ProK8S-1351Cilium 업그레이드가 정책은 초록으로 유지하면서 네임스페이스 하나가 east-west 트래픽을 잃음클러스터 네트워킹 업그레이드는 전반적으로 초록인데, pod CIDR를 재할당한 뒤 노드 하나의 워크로드만 peer에 닿지 못합니다.Kubernetes고급16분ProK8S-1331Cilium 정책 롤아웃은 맞아 보이는데 네임스페이스 하나가 계속 트래픽을 잃음label 정리 후, 일부 노드에서만 나타나는 네임스페이스별 트래픽 손실이 뒤따릅니다.Kubernetes고급16분ProK8S-1341Cilium 클러스터 업그레이드가 스모크 테스트를 통과했는데 네임스페이스 하나가 DNS egress를 잃음네트워크 정책을 정리한 뒤, 테스트 pod에서는 이름 해석이 정상으로 보이는데 네임스페이스 하나가 간헐적으로 외부 접근을 잃습니다.Kubernetes고급16분ProK8S-1303Helm으로 컨트롤러를 이전하기 전까지는 leader election이 정상으로 보임컨트롤러를 재설치하거나 네임스페이스 간에 옮긴 뒤, 뚜렷한 RBAC 거부 없이 요동치기 시작합니다.Kubernetes고급16분ProK8S-1314ingress 이전이 hostname은 보존하고도 실패팀이 ingress 컨트롤러를 이전한 뒤, TLS와 라우팅은 정상으로 보이는데 hostname 하나만 인증이나 리다이렉트 흐름에서 실패하기 시작합니다.Kubernetes고급16분ProK8S-1304validating webhook이 노드 로컬 DNS 노드에서만 타임아웃일부 노드만 다른 DNS 경로를 지나기 때문에 서비스 이름 변경 후 admission 실패가 무작위처럼 보입니다.Kubernetes고급16분Pro