CKA
CKA 준비에 도움이 되는 장애 대응 문제 955개를 모았습니다.
먼저 읽을 가이드
ConfigMap은 바뀌었는데 Pod가 이전 값을 계속 쓸 때ConfigMap 업데이트 이후 envFrom, subPath, volume projection, rollout trigger 차이로 값이 갱신되지 않는 상황Kubernetes3분 읽기CoreDNS는 Running인데 DNS 조회만 실패할 때CoreDNS Pod는 정상처럼 보이지만 kube-dns 경로, upstream, node-local-dns, policy에서 실패하는 상황Kubernetes3분 읽기CrashLoopBackOff가 뜰 때 가장 먼저 볼 것Pod가 반복 재시작하면서 이전 로그와 event에 실제 원인이 남는 상황Kubernetes5분 읽기
추천 문제
검수된 문제를 먼저, 그다음 시나리오가 자세한 문제를 보여 줍니다.
CICD-064앱 배포는 끝났는데 Helm 업그레이드가 post-upgrade 훅에서 시간 초과주문 서비스 v5.1을 Helm으로 운영에 배포했습니다.검수CI/CD중급20분무료CICD-103카나리가 승인됐는데 새 버전이 500을 쏟아냄: 배포된 매니페스트에 readiness probe가 없음API 카나리 배포가 Argo CD에서 Healthy로 표시되고 자동 승격까지 됐는데, 승격 직후 오류율이 급증해 긴급 롤백했습니다.검수CI/CD중급18분무료K8S-001ConfigMap 변경 직후 CrashLoopBackOff: 이미지는 그대로인데 파드가 계속 재시작오후 2시 10분, 결제 API(payment-api)의 Helm 값 파일을 고친 PR이 운영에 배포됐습니다.검수Kubernetes입문18분무료K8S-004운영 네임스페이스에서만 ImagePullBackOff: 프라이빗 레지스트리 401새 결제 워커를 사내 프라이빗 레지스트리(registry.acme.dev)에서 받아 배포합니다.검수Kubernetes입문17분무료K8S-008노드 풀을 교체한 뒤 GPU 추론 파드가 계속 Pending비용을 줄이려고 GPU 노드 풀을 g4dn 인스턴스에서 g5 인스턴스로 교체하는 작업을 어젯밤에 끝냈습니다.검수Kubernetes중급21분무료K8S-011롤링 업데이트가 끝나지 않음: 새 파드가 Running인데 READY 0/1오후 3시에 주문 API 새 버전을 배포했는데 20분째 롤아웃이 끝나지 않습니다.검수Kubernetes입문16분무료
모든 문제 955개
CrashLoopBackOff: 새 버전 배포 뒤 파드가 계속 재시작새 버전을 배포하자 파드가 몇 초 만에 꺼졌다 켜지기를 반복합니다.검수Kubernetes입문3분무료ImagePullBackOff: 새 버전 파드가 이미지를 받지 못함이미지 태그를 새 버전으로 바꿔 배포했더니 새 파드가 ImagePullBackOff에서 멈췄습니다.검수Kubernetes입문3분무료Exit Code 137(OOMKilled): 컨테이너가 부하 때마다 재시작정산 API 파드가 요청이 몰리는 시간에만 재시작됩니다.검수Kubernetes입문3분무료Pending: 레플리카를 늘렸더니 새 파드가 뜨지 않음replicas를 3에서 10으로 늘렸더니 새 파드 7개가 몇 분째 Pending입니다.검수Kubernetes입문3분무료Service로 호출이 안 됨: Endpoints가 비어 있음결제 파드는 Running인데 http://payment:8080 호출이 안 되고 Endpoints가 비어 있습니다.검수Kubernetes입문3분무료Ingress 404 Not Found: 새로 연결한 www 주소만 404www.shop.example.com을 새로 연결했더니 shop.example.com은 되는데 www 주소만 nginx 404가 납니다.검수Kubernetes입문3분무료CICD-103카나리가 승인됐는데 새 버전이 500을 쏟아냄: 배포된 매니페스트에 readiness probe가 없음API 카나리 배포가 Argo CD에서 Healthy로 표시되고 자동 승격까지 됐는데, 승격 직후 오류율이 급증해 긴급 롤백했습니다.검수CI/CD중급18분무료K8S-030새 Ingress가 외부 도메인에서 404: 다른 인그레스 컨트롤러가 가져감클러스터에는 외부 공개용(nginx-external)과 사내용(nginx-internal) 인그레스 컨트롤러가 따로 있습니다.검수Kubernetes중급19분무료CICD-064앱 배포는 끝났는데 Helm 업그레이드가 post-upgrade 훅에서 시간 초과주문 서비스 v5.1을 Helm으로 운영에 배포했습니다.검수CI/CD중급20분무료K8S-1192새 노드에 배포하면 liveness probe가 기동 중인 앱을 계속 죽임주문 조회 서비스(JVM)에 인터넷에서 찾은 공개 예제의 probe 설정을 그대로 붙여 두었습니다.검수Kubernetes고급21분무료K8S-011롤링 업데이트가 끝나지 않음: 새 파드가 Running인데 READY 0/1오후 3시에 주문 API 새 버전을 배포했는데 20분째 롤아웃이 끝나지 않습니다.검수Kubernetes입문16분무료K8S-034NetworkPolicy를 적용한 뒤 서비스 이름만 안 풀림: IP로는 호출 성공보안 점검 후속 조치로 payments 네임스페이스에 '기본 차단' egress 정책을 걸고, 원장 서비스(ledger) 8080 포트로 나가는 것만 허용했습니다.검수Kubernetes중급18분무료K8S-008노드 풀을 교체한 뒤 GPU 추론 파드가 계속 Pending비용을 줄이려고 GPU 노드 풀을 g4dn 인스턴스에서 g5 인스턴스로 교체하는 작업을 어젯밤에 끝냈습니다.검수Kubernetes중급21분무료K8S-033PVC를 200Gi로 늘렸는데 파드 안 디스크는 그대로 100G주문 DB(StatefulSet)의 디스크 사용률이 85%를 넘어, 어제 오후에 PVC 요청을 100Gi에서 200Gi로 늘렸습니다.검수Kubernetes중급22분무료K8S-036트래픽이 몰려 CPU가 가득 찼는데 HPA가 파드를 늘리지 않음점심 프로모션으로 API 트래픽이 평소의 4배가 됐습니다.검수Kubernetes입문16분무료K8S-004운영 네임스페이스에서만 ImagePullBackOff: 프라이빗 레지스트리 401새 결제 워커를 사내 프라이빗 레지스트리(registry.acme.dev)에서 받아 배포합니다.검수Kubernetes입문17분무료K8S-001ConfigMap 변경 직후 CrashLoopBackOff: 이미지는 그대로인데 파드가 계속 재시작오후 2시 10분, 결제 API(payment-api)의 Helm 값 파일을 고친 PR이 운영에 배포됐습니다.검수Kubernetes입문18분무료K8S-1612CoreDNS는 정상인데 한 서비스 이름만 NXDOMAIN주문 서비스(orders)를 legacy 네임스페이스에서 shop 네임스페이스로 옮겼습니다.검수Kubernetes입문6분무료K8S-1621ServiceMonitor를 만들었는데 Prometheus 타깃이 0개결제팀 네임스페이스의 라벨을 조직 개편에 맞춰 team=payments-legacy에서 team=payments로 바꿨습니다.검수Kubernetes입문6분무료K8S-1611라벨 체계를 바꾼 뒤 Service endpoint가 0개: 파드는 Running인데 503주문 API의 라벨을 표준 라벨로 정리하면서 Deployment를 새 라벨(app.kubernetes.io/name)로 다시 만들었습니다(Deployment selector는 바꿀 수 없어서). 새 파드 3개는 모…검수Kubernetes입문6분무료