← 문제 라이브러리
K8s L4 K8S 216 · 18 min

로컬 스토리지 워크로드가 정상으로 보이다가 축소가 지역성을 만족하는 유일한 노드를 제거 (failover 리허설 중)

Kubernetes 원문 시나리오에서 Rollout Stuck 신호를 기준으로 근본 원인과 안전한 복구 방향을 정리하는 문제입니다.

K8sFoundation OpsLevel 4무료18 min
시나리오

A local storage workload looks healthy until scale-down removes the only node that satisfies its locality during a failover rehearsal 상황에서 evaluate locality-bound workloads separately from generic scale-down policy를 중심으로 원인을 좁혀가는 시나리오입니다.

먼저 볼 것
  • 이벤트, 로그, 스펙 불일치를 빠르게 읽기
  • 서비스 경로와 스케줄링 조건을 함께 점검하기
  • 장애 증상과 리소스 정의를 연결해서 원인을 좁히기
점검 체크리스트
  1. 증상이 Pod, Service, Ingress, Node 중 어디에 있는지 먼저 구분합니다.
  2. kubectl describe, logs, events 결과를 같은 타임라인으로 정리합니다.
  3. 재현 조건과 설정 오타를 분리해서 확인합니다.
복구와 재발 방지

서비스 영향을 줄이는 가장 작은 조치를 먼저 선택하고, 이후 rollout 재시도, 설정 되돌리기, probe 조정, 트래픽 우회를 재발 방지 항목으로 분리합니다.

같이 보면 좋은 질문
이 문제에서 원문은 그대로 읽어야 하나요?

네. 제목과 시나리오는 실제 장애 단서이므로 그대로 유지합니다. 한국어 풀이는 판단 순서와 답안 구조를 돕기 위한 보조 설명입니다.

기술 용어와 명령어는 번역해야 하나요?

아니요. Pod event, rollout, Service/Endpoint 같은 기술 용어와 kubectl 같은 명령어는 영어 원문을 유지하세요.

답안에서 가장 중요한 기준은 무엇인가요?

사용자 영향, 관찰한 근거, 최근 변경, 안전한 복구 방향을 한 번에 연결해 설명하는 것입니다.