주제문제 31개· 검수 문제 5개

Kubernetes Scheduling and Capacity

Kubernetes Scheduling and Capacity 관련 장애 문제 31개를 모았습니다. 검수된 문제부터 풀어 보세요.

먼저 읽을 가이드

추천 문제

검수된 문제를 먼저, 그다음 시나리오가 자세한 문제를 보여 줍니다.

모든 문제 31개

Pending: 레플리카를 늘렸더니 새 파드가 뜨지 않음replicas를 3에서 10으로 늘렸더니 새 파드 7개가 몇 분째 Pending입니다.검수Kubernetes입문3분무료K8S-030새 Ingress가 외부 도메인에서 404: 다른 인그레스 컨트롤러가 가져감클러스터에는 외부 공개용(nginx-external)과 사내용(nginx-internal) 인그레스 컨트롤러가 따로 있습니다.검수Kubernetes중급19분무료K8S-008노드 풀을 교체한 뒤 GPU 추론 파드가 계속 Pending비용을 줄이려고 GPU 노드 풀을 g4dn 인스턴스에서 g5 인스턴스로 교체하는 작업을 어젯밤에 끝냈습니다.검수Kubernetes중급21분무료K8S-036트래픽이 몰려 CPU가 가득 찼는데 HPA가 파드를 늘리지 않음점심 프로모션으로 API 트래픽이 평소의 4배가 됐습니다.검수Kubernetes입문16분무료노드 디스크 압박으로 파드가 무더기 Evicted오전부터 노드 두 대에서 파드 수십 개가 Evicted 상태로 쌓이고, 새 파드가 다른 노드로 옮겨지면서 클러스터 전체가 빡빡해졌습니다.검수Kubernetes중급18분무료K8S-021DaemonSet이 taint 걸린 노드만 빼고 모든 곳에 배포됨manifest는 맞아 보이는데 taint와 toleration 때문에 agent가 가장 중요한 노드에 닿지 못합니다.Kubernetes입문16분무료K8S-018cluster autoscaler가 켜져 있는데도 GPU 워크로드가 Pending에 머무는 문제오토스케일러는 동작 중이지만 특수 노드 그룹 조건 때문에 워크로드가 대기하는 상황입니다.Kubernetes고급29분ProK8S-007HPA가 붙어 있는데도 스케일이 오르지 않는 metrics 파이프라인 문제리소스 사용량은 높지만 autoscaler가 반응하지 않는 상황에서 metrics 흐름을 추적합니다.Kubernetes고급26분ProK8S-010StatefulSet PVC가 Pending에 머물며 롤아웃이 멈추는 문제StorageClass, access mode, 용량 조건이 맞지 않아 상태 저장 워크로드가 올라오지 않는 문제입니다.Kubernetes고급28분ProK8S-090노드 재부팅 폭풍 후 CSI node 플러그인은 정상인데 볼륨 마운트가 실패Kubernetes고급20분ProK8S-097CSI 스냅샷 복원은 끝났는데 파일시스템 UUID 충돌이 부트스트랩 스크립트를 혼란시킴스토리지는 다시 온라인인데 앱이 계속 실패합니다 — 복원된 파일시스템 신원이 시작 로직이 고유하다고 여기는 값과 충돌합니다.Kubernetes고급21분ProK8S-086로컬 ephemeral-storage 요청이 모든 노드 템플릿을 넘어 Cluster Autoscaler가 pending pod를 무시pod가 pending에 머물고 오토스케일링도 반응하지 않습니다 — 요청한 로컬 스토리지 프로파일이 확장 그룹의 어떤 노드 형태에도 맞지 않습니다.Kubernetes고급21분ProK8S-076복제 복구 테스트 후 VolumeSnapshot 복원이 엉뚱한 PVC 계보에 바인딩됨스냅샷 데이터는 유효한데 이후 복원이 엉뚱한 기대 체인에 붙습니다 — 테스트 중에 스냅샷 내용과 클론 이름을 너무 대충 재사용했습니다.Kubernetes고급22분ProK8S-028장수 연결 pod에서 노드 drain이 멈춤점검은 제대로 시작되는데 축출이 끝나지 않습니다 — 연결 draining과 종료 훅이 너무 오래 걸립니다.Kubernetes중급22분ProK8S-062노드 상실 후 오래된 VolumeAttachment 객체가 PVC 재연결을 막음대체 노드는 준비됐는데 워크로드가 볼륨을 마운트하지 못합니다 — 스토리지 컨트롤 경로가 아직 옛 attach가 살아 있다고 믿습니다.Kubernetes고급23분ProK8S-071AZ 장애 후 PodDisruptionBudget과 topology spread가 합법적인 복구 배치를 남기지 않음장애 전에는 워크로드에 replica가 충분했는데 zone 하나가 사라진 뒤 남은 규칙들 때문에 모든 복구 선택지가 분산이나 disruption 보장 중 하나를 어깁니다.Kubernetes고급24분ProK8S-069노드 풀 간 CNI MTU가 달라 노드 간 gRPC 호출이 실패노드 내부 트래픽은 깨끗한데 더 큰 노드 간 요청이 멈춥니다 — 노드 풀 하나가 다른 경로가 기대하는 것보다 작은 실효 MTU를 씁니다.Kubernetes고급24분ProK8S-073재시도 폭주로 emptyDir 요청 로그가 부풀어 ephemeral-storage 축출이 시작노드에 CPU와 메모리는 남아 있는데 pod가 evict됩니다 — 재시도가 많은 요청 로깅이 emptyDir에 쌓이면서 로컬 임시 스토리지가 찹니다.Kubernetes고급19분ProK8S-084maxUnavailable이, 이미 사용 불가 멤버가 하나 있는 taint 걸린 노드 그룹과 충돌해 DaemonSet 갱신이 멈춤업데이트 전략은 보수적으로 보이는데 롤아웃 진행이 멈춥니다 — taint된 그룹의 현재 불가용 상태가 이미 허용된 업데이트 예산을 넘었습니다.Kubernetes고급20분ProK8S-095마지막 정상 노드가 이미 매칭되는 앱 label을 갖고 있어 pod anti-affinity가 복원을 계속 막음용량은 있는데 엄격한 anti-affinity 규칙이 복구를 막습니다 — 살아남은 노드가 이미 같은 워크로드 계열을 돌리고 있습니다.Kubernetes고급20분Pro