Kubernetes Scheduling and Capacity
Kubernetes Scheduling and Capacity 관련 장애 문제 31개를 모았습니다. 검수된 문제부터 풀어 보세요.
먼저 읽을 가이드
ConfigMap은 바뀌었는데 Pod가 이전 값을 계속 쓸 때ConfigMap 업데이트 이후 envFrom, subPath, volume projection, rollout trigger 차이로 값이 갱신되지 않는 상황Kubernetes3분 읽기CoreDNS는 Running인데 DNS 조회만 실패할 때CoreDNS Pod는 정상처럼 보이지만 kube-dns 경로, upstream, node-local-dns, policy에서 실패하는 상황Kubernetes3분 읽기CrashLoopBackOff가 뜰 때 가장 먼저 볼 것Pod가 반복 재시작하면서 이전 로그와 event에 실제 원인이 남는 상황Kubernetes5분 읽기
추천 문제
검수된 문제를 먼저, 그다음 시나리오가 자세한 문제를 보여 줍니다.
K8S-008노드 풀을 교체한 뒤 GPU 추론 파드가 계속 Pending비용을 줄이려고 GPU 노드 풀을 g4dn 인스턴스에서 g5 인스턴스로 교체하는 작업을 어젯밤에 끝냈습니다.검수Kubernetes중급21분무료K8S-030새 Ingress가 외부 도메인에서 404: 다른 인그레스 컨트롤러가 가져감클러스터에는 외부 공개용(nginx-external)과 사내용(nginx-internal) 인그레스 컨트롤러가 따로 있습니다.검수Kubernetes중급19분무료K8S-036트래픽이 몰려 CPU가 가득 찼는데 HPA가 파드를 늘리지 않음점심 프로모션으로 API 트래픽이 평소의 4배가 됐습니다.검수Kubernetes입문16분무료노드 디스크 압박으로 파드가 무더기 Evicted오전부터 노드 두 대에서 파드 수십 개가 Evicted 상태로 쌓이고, 새 파드가 다른 노드로 옮겨지면서 클러스터 전체가 빡빡해졌습니다.검수Kubernetes중급18분무료Pending: 레플리카를 늘렸더니 새 파드가 뜨지 않음replicas를 3에서 10으로 늘렸더니 새 파드 7개가 몇 분째 Pending입니다.검수Kubernetes입문3분무료K8S-007HPA가 붙어 있는데도 스케일이 오르지 않는 metrics 파이프라인 문제리소스 사용량은 높지만 autoscaler가 반응하지 않는 상황에서 metrics 흐름을 추적합니다.Kubernetes고급26분Pro
모든 문제 31개
Pending: 레플리카를 늘렸더니 새 파드가 뜨지 않음replicas를 3에서 10으로 늘렸더니 새 파드 7개가 몇 분째 Pending입니다.검수Kubernetes입문3분무료K8S-030새 Ingress가 외부 도메인에서 404: 다른 인그레스 컨트롤러가 가져감클러스터에는 외부 공개용(nginx-external)과 사내용(nginx-internal) 인그레스 컨트롤러가 따로 있습니다.검수Kubernetes중급19분무료K8S-008노드 풀을 교체한 뒤 GPU 추론 파드가 계속 Pending비용을 줄이려고 GPU 노드 풀을 g4dn 인스턴스에서 g5 인스턴스로 교체하는 작업을 어젯밤에 끝냈습니다.검수Kubernetes중급21분무료K8S-036트래픽이 몰려 CPU가 가득 찼는데 HPA가 파드를 늘리지 않음점심 프로모션으로 API 트래픽이 평소의 4배가 됐습니다.검수Kubernetes입문16분무료노드 디스크 압박으로 파드가 무더기 Evicted오전부터 노드 두 대에서 파드 수십 개가 Evicted 상태로 쌓이고, 새 파드가 다른 노드로 옮겨지면서 클러스터 전체가 빡빡해졌습니다.검수Kubernetes중급18분무료K8S-021DaemonSet이 taint 걸린 노드만 빼고 모든 곳에 배포됨manifest는 맞아 보이는데 taint와 toleration 때문에 agent가 가장 중요한 노드에 닿지 못합니다.Kubernetes입문16분무료K8S-018cluster autoscaler가 켜져 있는데도 GPU 워크로드가 Pending에 머무는 문제오토스케일러는 동작 중이지만 특수 노드 그룹 조건 때문에 워크로드가 대기하는 상황입니다.Kubernetes고급29분ProK8S-007HPA가 붙어 있는데도 스케일이 오르지 않는 metrics 파이프라인 문제리소스 사용량은 높지만 autoscaler가 반응하지 않는 상황에서 metrics 흐름을 추적합니다.Kubernetes고급26분ProK8S-010StatefulSet PVC가 Pending에 머물며 롤아웃이 멈추는 문제StorageClass, access mode, 용량 조건이 맞지 않아 상태 저장 워크로드가 올라오지 않는 문제입니다.Kubernetes고급28분ProK8S-090노드 재부팅 폭풍 후 CSI node 플러그인은 정상인데 볼륨 마운트가 실패Kubernetes고급20분ProK8S-097CSI 스냅샷 복원은 끝났는데 파일시스템 UUID 충돌이 부트스트랩 스크립트를 혼란시킴스토리지는 다시 온라인인데 앱이 계속 실패합니다 — 복원된 파일시스템 신원이 시작 로직이 고유하다고 여기는 값과 충돌합니다.Kubernetes고급21분ProK8S-086로컬 ephemeral-storage 요청이 모든 노드 템플릿을 넘어 Cluster Autoscaler가 pending pod를 무시pod가 pending에 머물고 오토스케일링도 반응하지 않습니다 — 요청한 로컬 스토리지 프로파일이 확장 그룹의 어떤 노드 형태에도 맞지 않습니다.Kubernetes고급21분ProK8S-076복제 복구 테스트 후 VolumeSnapshot 복원이 엉뚱한 PVC 계보에 바인딩됨스냅샷 데이터는 유효한데 이후 복원이 엉뚱한 기대 체인에 붙습니다 — 테스트 중에 스냅샷 내용과 클론 이름을 너무 대충 재사용했습니다.Kubernetes고급22분ProK8S-028장수 연결 pod에서 노드 drain이 멈춤점검은 제대로 시작되는데 축출이 끝나지 않습니다 — 연결 draining과 종료 훅이 너무 오래 걸립니다.Kubernetes중급22분ProK8S-062노드 상실 후 오래된 VolumeAttachment 객체가 PVC 재연결을 막음대체 노드는 준비됐는데 워크로드가 볼륨을 마운트하지 못합니다 — 스토리지 컨트롤 경로가 아직 옛 attach가 살아 있다고 믿습니다.Kubernetes고급23분ProK8S-071AZ 장애 후 PodDisruptionBudget과 topology spread가 합법적인 복구 배치를 남기지 않음장애 전에는 워크로드에 replica가 충분했는데 zone 하나가 사라진 뒤 남은 규칙들 때문에 모든 복구 선택지가 분산이나 disruption 보장 중 하나를 어깁니다.Kubernetes고급24분ProK8S-069노드 풀 간 CNI MTU가 달라 노드 간 gRPC 호출이 실패노드 내부 트래픽은 깨끗한데 더 큰 노드 간 요청이 멈춥니다 — 노드 풀 하나가 다른 경로가 기대하는 것보다 작은 실효 MTU를 씁니다.Kubernetes고급24분ProK8S-073재시도 폭주로 emptyDir 요청 로그가 부풀어 ephemeral-storage 축출이 시작노드에 CPU와 메모리는 남아 있는데 pod가 evict됩니다 — 재시도가 많은 요청 로깅이 emptyDir에 쌓이면서 로컬 임시 스토리지가 찹니다.Kubernetes고급19분ProK8S-084maxUnavailable이, 이미 사용 불가 멤버가 하나 있는 taint 걸린 노드 그룹과 충돌해 DaemonSet 갱신이 멈춤업데이트 전략은 보수적으로 보이는데 롤아웃 진행이 멈춥니다 — taint된 그룹의 현재 불가용 상태가 이미 허용된 업데이트 예산을 넘었습니다.Kubernetes고급20분ProK8S-095마지막 정상 노드가 이미 매칭되는 앱 label을 갖고 있어 pod anti-affinity가 복원을 계속 막음용량은 있는데 엄격한 anti-affinity 규칙이 복구를 막습니다 — 살아남은 노드가 이미 같은 워크로드 계열을 돌리고 있습니다.Kubernetes고급20분Pro