벤더문제 586개· 검수 문제 4개

Kubernetes

Kubernetes 환경에서 일어나는 장애 문제 586개를 모았습니다.

모든 문제 586개

K8S-1336pod가 옛 노드에서는 서비스를 해석하고 새 노드에서 타임아웃DNS 서비스 이전 후 새로 추가된 노드의 pod에서만 타임아웃이나 오래된 해석 결과가 나옵니다.Kubernetes중급13분ProK8S-1302postStart 훅을 시작 게이트로 썼는데 트래픽이 너무 일찍 도착팀이 부트스트랩 단계를 라이프사이클 훅 안에 숨긴 뒤, pod 크래시는 없는데 초기 요청이 실패합니다.Kubernetes중급13분ProK8S-1332ServiceMonitor는 유효해 보이는데 Prometheus가 아무것도 수집하지 않음모니터링 리팩터로 manifest를 중앙화한 뒤 애플리케이션 하나가 scrape 대상에서 조용히 사라집니다.Kubernetes중급13분ProK8S-1340새 클러스터가 smoke test는 통과하고 나중에 알림을 잃음검증된 내부 예제로 모니터링 스택을 배포했는데, 새로 차트화한 구성 요소 하나에 타깃이 나타나지 않습니다.Kubernetes중급13분ProK8S-1358서비스 메시 sidecar 롤아웃이 안전해 보이는데 readiness가 요동sidecar 주입을 켠 뒤, 애플리케이션 로그는 정상인데 pod가 readiness에 실패하기 시작합니다.Kubernetes중급13분ProK8S-1354cert-manager 갱신 작업이 Pending에 머무름컨트롤 플레인 이전이 끝난 뒤, 워크로드 테스트상 webhook 배포는 정상인데 인증서 갱신이 실패하기 시작합니다.Kubernetes중급14분ProK8S-1326cert-manager 갱신은 성공했는데 새 인증서가 앱에 닿지 않음클러스터 상태에서는 인증서가 잘 교체되는데 애플리케이션이 재시작 전까지 옛 자료를 계속 제시합니다.Kubernetes중급14분ProK8S-1338Cilium 업그레이드가 정책 적용은 유지하면서 NodePort 경로 하나를 깨뜨림CNI를 점진적으로 업그레이드한 뒤 pod는 정상인데 일부 NodePort health check만 실패하기 시작합니다.Kubernetes중급14분ProK8S-1308ingress 컨트롤러가 새 설정 하나를 끝내 다시 로드하지 않음플랫폼 팀이 컨트롤러와 설정 네임스페이스를 분리한 뒤 ingress 설정 부류 하나가 조용히 적용되지 않습니다.Kubernetes중급14분ProK8S-1344StatefulSet pod는 올라오는데 readiness에 실패StatefulSet이 새 인프라에서 복구된 뒤 멤버 하나만 부트스트랩·신원 불일치로 readiness에 실패합니다.Kubernetes중급14분ProK8S-1322강제 삭제 후 StatefulSet pod가 Pending에 머무름장애 중 운영자가 멈춘 StatefulSet pod를 강제 삭제했는데, 대체 pod가 attach 관련 이벤트와 함께 Pending에 머무릅니다.Kubernetes중급14분ProK8S-1313노드 압박 후 CronJob이 두 번 실행노드 압박 이벤트 중 예약 점검 작업이 예상 밖으로 두 번 실행돼 하위에 중복 영향을 일으킵니다.Kubernetes중급14분ProK8S-1334레플리카는 정상인데 노드 drain이 멈춤점검 창이 시작됐는데 네임스페이스 하나가 애플리케이션 상태와 무관한 admission 오류로 노드 drain을 막습니다.Kubernetes중급14분ProK8S-1329새 노드에서만 Pod가 DNS 타임아웃을 기록스케일링으로 새 노드가 들어왔는데 거기 배치된 워크로드만 간헐적 DNS 해석 실패를 보이기 시작합니다.Kubernetes중급14분ProK8S-1301이미 존재하는 의존성에 대해 initContainer가 DNS에서 루프롤아웃이 의존 서비스와 그것을 쓰는 워크로드를 함께 만드는데, 처음 몇 개의 pod만 DNS 실패에서 끝내 회복하지 못합니다.Kubernetes중급14분ProK8S-1630NodeLocal DNS는 정상인데 노드 하나가 계속 오래된 이름을 해석CoreDNS upstream을 바꾼 뒤에도 노드 하나가 계속 오래된 이름을 해석합니다.Kubernetes중급10분ProK8S-1620PVC 확장은 성공했는데 pod 하나가 계속 공간 부족을 보고PVC를 확장한 뒤에도 pod 하나가 계속 공간이 없다고 보고합니다.Kubernetes중급10분ProK8S-1700Cilium 정책은 맞는데 DNS 경로 하나가 계속 실패Cilium 정책을 고친 뒤에도 워크로드 하나에서 DNS 경로가 계속 실패합니다.Kubernetes중급11분ProK8S-1720mesh route는 정상으로 보이는데 테넌트 하나가 계속 실패mesh route는 정상으로 보이는데 테넌트 하나가 계속 실패합니다.Kubernetes중급11분ProK8S-1790mesh route는 정상인데 클라이언트 하나가 계속 실패mesh route는 정상인데 클라이언트 하나가 계속 실패합니다.Kubernetes중급11분Pro