Resource Exhaustion
‘Resource Exhaustion’ 증상으로 나타나는 장애 문제 159개를 모았습니다.
먼저 읽을 가이드
ConfigMap은 바뀌었는데 Pod가 이전 값을 계속 쓸 때ConfigMap 업데이트 이후 envFrom, subPath, volume projection, rollout trigger 차이로 값이 갱신되지 않는 상황Kubernetes3분 읽기CoreDNS는 Running인데 DNS 조회만 실패할 때CoreDNS Pod는 정상처럼 보이지만 kube-dns 경로, upstream, node-local-dns, policy에서 실패하는 상황Kubernetes3분 읽기CrashLoopBackOff가 뜰 때 가장 먼저 볼 것Pod가 반복 재시작하면서 이전 로그와 event에 실제 원인이 남는 상황Kubernetes5분 읽기
추천 문제
검수된 문제를 먼저, 그다음 시나리오가 자세한 문제를 보여 줍니다.
셀프 호스티드 러너 No space left on device: 빌드가 도중에 실패사내 서버에 둔 GitHub Actions 러너에서 이미지 빌드가 'no space left on device'로 자주 실패합니다.검수CI/CD입문3분무료K8S-030새 Ingress가 외부 도메인에서 404: 다른 인그레스 컨트롤러가 가져감클러스터에는 외부 공개용(nginx-external)과 사내용(nginx-internal) 인그레스 컨트롤러가 따로 있습니다.검수Kubernetes중급19분무료K8S-033PVC를 200Gi로 늘렸는데 파드 안 디스크는 그대로 100G주문 DB(StatefulSet)의 디스크 사용률이 85%를 넘어, 어제 오후에 PVC 요청을 100Gi에서 200Gi로 늘렸습니다.검수Kubernetes중급22분무료K8S-036트래픽이 몰려 CPU가 가득 찼는데 HPA가 파드를 늘리지 않음점심 프로모션으로 API 트래픽이 평소의 4배가 됐습니다.검수Kubernetes입문16분무료노드 디스크 압박으로 파드가 무더기 Evicted오전부터 노드 두 대에서 파드 수십 개가 Evicted 상태로 쌓이고, 새 파드가 다른 노드로 옮겨지면서 클러스터 전체가 빡빡해졌습니다.검수Kubernetes중급18분무료Exit Code 137(OOMKilled): 컨테이너가 부하 때마다 재시작정산 API 파드가 요청이 몰리는 시간에만 재시작됩니다.검수Kubernetes입문3분무료
모든 문제 159개
No space left on device: 디스크가 가득 차 파일을 쓰지 못함API 서버가 'No space left on device' 오류를 내며 파일을 쓰지 못합니다.검수Linux입문3분무료CORS 오류: No 'Access-Control-Allow-Origin' header is presentapp.example.com에서 API를 부르면 브라우저에서만 막히고, curl로는 잘 됩니다.검수Security입문3분무료Exit Code 137(OOMKilled): 컨테이너가 부하 때마다 재시작정산 API 파드가 요청이 몰리는 시간에만 재시작됩니다.검수Kubernetes입문3분무료Too many open files: 요청이 몰리자 새 연결을 받지 못함사진 업로드 서버가 요청이 몰릴 때 새 연결을 받지 못하고 'Too many open files'를 남깁니다.검수Linux입문3분무료Pending: 레플리카를 늘렸더니 새 파드가 뜨지 않음replicas를 3에서 10으로 늘렸더니 새 파드 7개가 몇 분째 Pending입니다.검수Kubernetes입문3분무료셀프 호스티드 러너 No space left on device: 빌드가 도중에 실패사내 서버에 둔 GitHub Actions 러너에서 이미지 빌드가 'no space left on device'로 자주 실패합니다.검수CI/CD입문3분무료K8S-030새 Ingress가 외부 도메인에서 404: 다른 인그레스 컨트롤러가 가져감클러스터에는 외부 공개용(nginx-external)과 사내용(nginx-internal) 인그레스 컨트롤러가 따로 있습니다.검수Kubernetes중급19분무료LINUX-001디스크는 38%인데 No space left on device: 파일 업로드가 실패하는 inode 고갈새벽 3시, 주문 서버(order-01)의 애플리케이션 로그에 'no space left on device'가 쏟아지고 고객 첨부 파일 업로드가 전부 실패합니다.검수Linux입문16분무료LINUX-033큰 로그 파일을 지웠는데 디스크 사용률이 그대로 97%새벽에 웹 서버의 /var 파티션 사용률이 97%라는 경보가 왔습니다.검수Linux중급18분무료K8S-033PVC를 200Gi로 늘렸는데 파드 안 디스크는 그대로 100G주문 DB(StatefulSet)의 디스크 사용률이 85%를 넘어, 어제 오후에 PVC 요청을 100Gi에서 200Gi로 늘렸습니다.검수Kubernetes중급22분무료K8S-036트래픽이 몰려 CPU가 가득 찼는데 HPA가 파드를 늘리지 않음점심 프로모션으로 API 트래픽이 평소의 4배가 됐습니다.검수Kubernetes입문16분무료노드 디스크 압박으로 파드가 무더기 Evicted오전부터 노드 두 대에서 파드 수십 개가 Evicted 상태로 쌓이고, 새 파드가 다른 노드로 옮겨지면서 클러스터 전체가 빡빡해졌습니다.검수Kubernetes중급18분무료새벽마다 DB가 사라짐: OOM killer가 mysqld를 종료사내 주문 DB(MySQL)가 며칠에 한 번씩 새벽 2시 10분쯤 갑자기 내려갔다가 자동으로 다시 뜹니다.검수Linux중급18분무료OOMKilled: 큰 이미지가 몰릴 때마다 컨테이너가 재시작상품 이미지를 줄여 주는 리사이즈 API가 판매자들이 사진을 올리는 오후 시간대마다 재시작을 반복합니다.검수Kubernetes입문15분무료Too many open files: 이벤트 때 채팅 서버가 새 연결을 받지 못함라이브 이벤트가 시작되자 웹소켓 채팅 서버가 새 연결을 받지 못하고, 이미 붙어 있던 사용자만 대화가 됩니다.검수Linux입문15분무료LINUX-008메모리 누수처럼 보였지만 사실은 종료되지 않는 orphan 프로세스 문제메인 프로세스보다 주변 워커가 더 오래 남아 리소스를 점유하는 상황을 분석합니다.Linux중급21분무료LINUX-002/var 파티션 급증 원인을 du와 lsof로 좁혀가기삭제했는데 공간이 회수되지 않는 파일 핸들 문제까지 이어지는 실무형 디스크 분석 시나리오입니다.Linux중급24분무료K8S-019kubectl apply는 성공했는데 실제 리소스가 다른 네임스페이스에 생기는 문제현재 context와 manifest namespace 기본값이 달라 의도와 다른 위치에 배포되는 상황입니다.Kubernetes입문14분무료SECURITY-146SIEM 파서가 이제 IPv6 주소와 포트를 제대로 분리하는데 탐지 규칙 하나가 IPv4의 콜론 개수를 계속 전제해 조용히 매칭을 멈춤데이터 품질은 좋아졌는데 분석 하나가 이전의 깨진 표현에 의존하고 있었습니다.Security중급16분무료SECURITY-240텔레메트리 파서가 사용자명을 소문자로 바꾸는데 탐지 규칙 하나가 옛 대소문자 혼용 서비스 계정 형태에 계속 의존 (failover 리허설 중)데이터는 정규화됐는데 분석 하나가 아직 이전 표현을 기대합니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Security중급17분무료