벤더문제 586개· 검수 문제 4개

Kubernetes

Kubernetes 환경에서 일어나는 장애 문제 586개를 모았습니다.

모든 문제 586개

CICD-1476Argo CD wave 순서는 맞아 보이는데 네임스페이스 하나가 계속 교착generate 정책이 네임스페이스 범위 리소스를 추가로 만들기 시작한 뒤에만 GitOps 롤아웃이 멈춥니다.CI/CD고급13분ProK8S-1348cert-manager Certificate가 Pending에 머무름클러스터 전역 ingress annotation을 정리한 뒤 새 HTTP01 챌린지에서만 인증서 발급이 실패합니다.Kubernetes중급13분ProK8S-1466CSI 스냅샷 복원이 깨끗하게 마운트됐는데 앱이 계속 오래된 데이터를 봄롤백이 끝난 것으로 보이는데, pod를 다시 만들 때까지 stateful 워크로드 하나가 옛 블록을 계속 읽습니다.Kubernetes고급13분ProK8S-1318DaemonSet 업그레이드가 괜찮아 보이다가 노드 계열 하나가 로그를 잃음노드 이미지를 갱신한 뒤, collector DaemonSet은 Ready로 보고하는데 일부 노드에서만 host 로그가 나오지 않습니다.Kubernetes중급13분ProK8S-1450StatefulSet 롤백이 끝난 것으로 보이는데 canary 하나가 새 spec에 남음롤백이 끝났는데 멤버 하나가 계속 새 버전 동작을 보입니다.Kubernetes고급13분ProK8S-1457Velero CSI 복원이 PVC를 다시 만드는데 워크로드 하나가 계속 실패CSI 기반 복원이 일부만 성공하고 워크로드 하나가 PVC를 계속 다시 만들며 멈춰 있습니다.Kubernetes고급13분ProK8S-1408Velero 복원이 성공한 것으로 보이는데 앱이 끝내 ready가 되지 않음복원된 네임스페이스는 배포되는데, 복구 과정에서 sidecar 모드 키가 사라져 앱 하나가 멈춘 채로 남습니다.Kubernetes고급13분ProK8S-1382cert-manager CA injector가 한 네임스페이스는 갱신하고 다른 곳은 놓침차트 업그레이드로 label을 현대화한 뒤 admission 경로 하나만 오래된 CA 데이터로 실패하기 시작합니다.Kubernetes고급14분ProK8S-1394cert-manager HTTP01 solver pod는 올라오는데 챌린지가 계속 실패dual-stack ingress를 배포한 뒤 hostname 집합 하나에서 HTTP01 인증서 발급이 간헐적으로 깨집니다.Kubernetes고급14분ProK8S-1397Cilium FQDN 정책이 패키지 미러를 허용하는데 노드 부트스트랩이 계속 실패mirror 도메인이 정책에 있는데도 콜드 스타트에서만 노드 부트스트랩이나 업그레이드가 실패합니다.Kubernetes고급14분ProK8S-1387Cilium host 방화벽 롤아웃이 node-local DNS를 차단host 방화벽 정책이 워크로드에는 잘 적용되고, 이후 노드 로컬 구성 요소가 DNS 해석에 실패하기 시작합니다.Kubernetes고급14분ProK8S-1442Gatekeeper 규칙은 정상으로 보이는데 금지된 객체 하나가 계속 생성admission 부하가 몰릴 때만 금지된 리소스가 나타납니다.Kubernetes고급14분ProK8S-1432Gatekeeper 롤아웃은 정상으로 보이는데 금지된 객체 하나가 계속 통과webhook 스택이 커진 뒤 admission 부하가 몰릴 때만 금지된 객체 일부가 통과합니다.Kubernetes고급14분ProK8S-1422Gatekeeper 업그레이드는 정상으로 보이는데 한 팀이 계속 금지된 리소스를 생성Gatekeeper constraint는 그대로인데 admission 스택을 확장한 뒤 금지된 리소스가 간헐적으로 나타납니다.Kubernetes고급14분ProK8S-1310Grafana Agent remote_write는 연결된 것으로 보이는데 클러스터 메트릭 버스트를 버림압박이 해소된 뒤 메트릭 수집은 재개되는데 장애 구간의 과거 공백은 대시보드에서 끝내 채워지지 않습니다.Kubernetes중급14분ProK8S-1369Hubble flow 뷰는 워크로드 트래픽을 허용으로 보여주는데 앱이 계속 실패운영자가 Hubble로 연결 문제를 조사하다가, 신뢰하던 워크로드 흐름 뷰 밖에서 거부가 일어났음을 발견합니다.Kubernetes고급14분ProK8S-1379Hubble 워크로드 뷰는 허용으로 보여주는데 앱이 계속 실패운영자가 Hubble로 트래픽을 디버깅하다가, 실제 차단이 그것이 시각화한 워크로드 경로 밖이었음을 발견합니다.Kubernetes고급14분ProK8S-1306Promtail이 파일을 잘 따라가다가 로그 rotation이 빨라지면 뒤처짐Promtail 자체는 크래시나 인증 오류를 보고하지 않는데도 바쁜 클러스터에서 단명 컨테이너 로그가 사라지기 시작합니다.Kubernetes중급14분ProK8S-1418Velero 복원은 끝났는데 워크로드 하나가 끝내 안정화되지 않음네임스페이스 복원으로 커스텀 리소스는 돌아왔는데, 구성 요소를 수동 재시작하기 전까지 컨트롤러 관리 앱 하나가 안정되지 않습니다.Kubernetes고급14분ProK8S-1438Velero 복원이 CRD를 되살렸는데 컨트롤러 하나가 계속 깨진 상태복원이 끝난 것으로 보이는데 컨트롤러 pod를 재시작할 때까지 컨트롤러 관리 워크플로 하나가 깨진 채로 남습니다.Kubernetes고급14분Pro