Kubernetes Workload Reliability
Kubernetes Workload Reliability 관련 장애 문제 44개를 모았습니다. 검수된 문제부터 풀어 보세요.
먼저 읽을 가이드
추천 문제
모든 문제 44개
K8S-216로컬 스토리지 워크로드가 정상으로 보이다가 축소가 지역성을 만족하는 유일한 노드를 제거 (failover 리허설 중)데이터가 남아 있어 컴퓨트 용량은 유지되는데 스케줄 가능성이 사라집니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes고급18분ProK8S-107이미지 파일시스템 축출 임계값은 설정돼 있는데 정작 노드 압박은 rootfs에 있어 kubelet이 부풀어 오른 로그 디렉터리를 끝내 축출하지 않음노드에 압박 징후가 보이는데 eviction이 발동하지 않습니다 — 고갈된 파티션이 활성 임계값이 다루는 대상이 아닙니다.Kubernetes고급18분ProK8S-330etcd 데이터 복원은 성공하는데 API 서버 하나가 계속 오래된 peer 목록을 가리켜 죽은 엔드포인트를 quorum 로직에 계속 다시 밀어 넣음 (failover 리허설 중)뒷단 저장소는 정상인데 컨트롤 플레인 멤버 설정이 계속 옛 클러스터 맵을 신뢰합니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes고급19분ProK8S-276kubelet 축출 임계값은 imagefs를 감시하는데 정작 다른 곳의 emptyDir 증가가 노드 ephemeral 저장소를 고갈 (failover 리허설 중)노드 압박은 실재하는데 선택된 신호가 엉뚱한 파일시스템을 가리킵니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes고급19분ProK8S-282mutating webhook이 이후 affinity 규칙에 필요한 런타임 label을 주입하는데 정작 스케줄링 결정은 그 label이 생기기 전에 일어남 (failover 리허설 중)최종 pod 메타데이터는 맞아 보이는데 초기 배치 결정은 그 정보 없이 내려졌습니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes고급19분ProK8S-246PodDisruptionBudget은 충분한 정상 pod를 세는데 anti-affinity가 대체본이 배치되는 것을 막음 (failover 리허설 중)가용성 계산은 안전해 보이는데 배치 규칙이 복구를 불가능하게 만듭니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes고급19분ProK8S-222StatefulSet ordinal이 재활용된 PVC 이름으로 돌아오는데 sidecar 하나가 계속 옛 pod 신원을 고정 (failover 리허설 중)스토리지는 정상인데 동반 프로세스 하나가 stateful 멤버를 계속 직전 ordinal 인스턴스인 것처럼 대합니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes고급19분ProK8S-306StatefulSet 복원이 볼륨 데이터는 되살렸는데 ordinal별 peer 신원 하나가 계속 failover 이전 클러스터 멤버를 가리킴 (failover 리허설 중)데이터는 돌아왔는데 peer 관계 모델이 아직 옛 신원에 붙어 있습니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes고급19분ProK8S-115감사 로그 백엔드가 멈추면서 admission 지연이 급증Kubernetes고급19분ProK8S-152복원된 etcd 멤버가 데이터 디렉터리에 옛 클러스터 ID를 지닌 채 재합류해, quorum 변동 속에서 컨트롤 플레인 쓰기가 실패하기 시작노드는 다시 온라인인데 낡은 identity 메타데이터가 컨트롤 플레인을 불안정하게 만듭니다.Kubernetes고급19분ProK8S-162헬퍼 컨트롤러가 노드 drain이 축출하는 속도보다 빠르게 pod를 다시 만듦 (failover 리허설 중)제어 루프 하나가 의도한 disruption을 계속 되돌려 점검이 멈춥니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes고급19분ProK8S-1121topology spread 규칙은 균형 잡혀 보임 (Rollout Stuck)A topology spread rule looks balanced (Rollout Stuck) focuses on kubernetes-workload-reliability and asks the reader to isolate Rollout Stuck. 실무에서는 Rollout Stuck 증상만 보고 Pod 하나에 매달리지 말고 이벤트, 이전 로그, Service/Endpoint, 최근 배포 변경을 한 번에 묶어 보는 편이 오진을 줄입니다.Kubernetes고급31분ProK8S-153node selector가 새 GPU 노드 풀 label에 매칭하는데 부트스트랩 중 taint가 추가돼 워크로드가 끝내 거기 배치되지 않음스케줄러가 label로는 올바른 노드를 찾는데 다른 admission 규칙이 그 노드를 계속 배제합니다.Kubernetes중급15분ProK8S-150ConfigMap 리로드 sidecar가 inode 변경을 감시하는데 projected 볼륨은 symlink 교체로 갱신돼 앱이 끝내 리로드하지 않음pod 안에 설정 변경은 있는데 watcher 로직이 Kubernetes가 실제로 쓰는 파일시스템 변형 형태를 관측하지 못합니다.Kubernetes중급16분ProK8S-147Deployment가 maxUnavailable 0을 쓰는데도 노드 압박으로 옛 pod가 축출돼 롤아웃이 잠시 의도한 하한 아래로 떨어짐롤아웃 전략은 보수적인데 외부 eviction 압력이 업데이트 가정을 뒤엎습니다.Kubernetes중급16분ProK8S-270projected ConfigMap 갱신이 심볼릭 링크를 교체한 뒤 inotify 기반 sidecar가 엉뚱한 inode 집합을 감시 (failover 리허설 중)설정 변경은 있는데 watcher 로직이 올바른 파일시스템 이벤트를 끝내 보지 못합니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes중급16분ProK8S-139롤아웃 중 HPA 축소 안정화가 여분 레플리카를 붙잡아, Deployment 예산이 다음 리비전에 필요한 용량을 끝내 비우지 못함뚜렷하게 깨진 건 없는데 컨트롤러 안전 창이 겹쳐 가용 자원에서 교착이 생깁니다.Kubernetes중급16분ProK8S-155앱이 downward API label에 의존하는데 롤아웃 컨트롤러가 label 키를 바꿔, pod가 크래시 없이 빈 파일을 계속 읽음배포는 성공하는데 런타임 설정이 조용히 나빠집니다 — 메타데이터 계약 하나가 바뀌었습니다.Kubernetes중급16분ProK8S-318ConfigMap 핫 리로드가 주 컨테이너에서는 되는데 sidecar가 이전 스키마를 캐시한 채 마운트된 파일을 다시 열지 않음 (failover 리허설 중)pod에는 새 설정이 있는데 pod 안의 모든 프로세스가 그것을 아는 건 아닙니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes중급17분ProK8S-288PodDisruptionBudget이 총량으로는 만족되는데 대상 drain을 위한 정상 replica가 남지 않은 토폴로지 도메인이 있음 (failover 리허설 중)전체 대수는 안전해 보이는데 지역 단위 점검의 영향 범위는 그렇지 않습니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes중급17분Pro