Cluster Maintenance
Cluster Maintenance 관련 장애 문제 81개를 모았습니다. 검수된 문제부터 풀어 보세요.
먼저 읽을 가이드
ConfigMap은 바뀌었는데 Pod가 이전 값을 계속 쓸 때ConfigMap 업데이트 이후 envFrom, subPath, volume projection, rollout trigger 차이로 값이 갱신되지 않는 상황Kubernetes3분 읽기CoreDNS는 Running인데 DNS 조회만 실패할 때CoreDNS Pod는 정상처럼 보이지만 kube-dns 경로, upstream, node-local-dns, policy에서 실패하는 상황Kubernetes3분 읽기CrashLoopBackOff가 뜰 때 가장 먼저 볼 것Pod가 반복 재시작하면서 이전 로그와 event에 실제 원인이 남는 상황Kubernetes5분 읽기
추천 문제
검수된 문제를 먼저, 그다음 시나리오가 자세한 문제를 보여 줍니다.
모든 문제 81개
보안 업데이트로 재부팅한 노드만 NotReady: kubelet이 시작되지 않음어젯밤 노드들에 운영체제 보안 업데이트를 적용하고 차례로 재부팅했습니다.검수Kubernetes중급16분무료SECURITY-1369Ubuntu bastion 패치 실행은 끝났는데 SSH 신뢰가 깨짐일상 패치가 성공한 뒤, 접근 정책을 의도적으로 바꾼 적이 없는데도 자동 SSH 클라이언트가 bastion을 거부하기 시작합니다.Security고급13분ProSECURITY-1359Ubuntu bastion 패치 창은 끝났는데 SSH 신뢰가 깨짐일상 패치가 끝난 뒤, 접근 정책을 의도적으로 바꾼 적이 없는데도 자동 SSH 클라이언트가 bastion을 신뢰하지 않게 됩니다.Security고급14분ProSECURITY-1349Ubuntu bastion 패치 창은 성공했는데 SSH 신뢰가 깨짐일상 패치를 마친 뒤, 접근 통제를 의도적으로 바꾼 적이 없는데도 자동 SSH 클라이언트가 bastion을 거부합니다.Security고급14분ProSECURITY-1327admission 정책 롤아웃이 네임스페이스 하나만 깨뜨림webhook 서명자를 교체했는데 클러스터 일부만 인증서 신뢰 오류로 admission을 거부하기 시작합니다.Security고급15분ProNETWORK-1397MLAG 쌍이 평상시 트래픽은 나르는데 재해 복구 테스트가 실패템플릿을 나눠 스위치 역할을 정리한 뒤, DR이나 orphan failover 트래픽이 standby가 필요해질 때만 실패합니다.Network고급15분ProSECURITY-1318Kubernetes admission webhook이 유효한 TLS를 제공하는데 요청이 계속 실패클러스터가 webhook 서빙 인증서를 제자리 교체했는데, pod와 서비스는 정상인 채로 admission 실패가 나타납니다.Security고급16분ProSECURITY-1316SSH CA 배포가 host 인증서는 제대로 서명하는데 엔지니어가 계속 principal 불일치 경고를 봄팀이 SSH host 인증서를 도입한 뒤, 명명을 정리하면서 bastion 경로 하나에서만 principal 불일치 경고가 발생합니다.Security중급13분ProNETWORK-1359pfSense HA 동기화는 성공을 보고하는데 패키지 VPN 하나가 보조 장비에서 끝내 돌아오지 않음HA 방화벽 업그레이드가 코어 경로 failover는 통과하는데 보조 노드에서만 패키지 관리 VPN 하나가 실패합니다.Network고급14분ProNETWORK-1369pfSense HA 쌍은 깨끗이 동기화되는데 패키지 VPN 하나가 계속 깨진 상태HA 방화벽 업그레이드가 성공한 것으로 보이는데, 보조 노드로 failover한 뒤에만 패키지 관리 VPN 하나가 실패합니다.Network고급14분ProLINUX-1323rootless Docker 서비스가 재부팅 전까지만 됨노드 이미지를 갱신한 뒤, 재부팅하면 누군가 수동으로 로그인할 때까지 rootless 컨테이너 서비스가 내려가 있습니다.Linux고급14분ProSECURITY-1335Ubuntu unattended upgrade가 패키지는 보호하고 bastion 하나를 접근 불가로 만듦강화된 bastion이 unattended 업그레이드를 받은 뒤, host 신원을 고정해 둔 하위 시스템이 그것을 더는 신뢰하지 않습니다.Security중급14분ProK8S-1361Cilium 롤아웃 후 네임스페이스 하나가 도달 불가플랫폼 팀이 label을 표준화한 뒤 일부 노드에서만 네임스페이스 하나가 east-west 트래픽을 잃습니다.Kubernetes고급15분ProK8S-1371Cilium 업그레이드 후 네임스페이스 하나가 도달 불가label 정리를 배포한 뒤 일부 노드에서만 네임스페이스 하나가 트래픽을 잃습니다.Kubernetes고급15분ProK8S-1327DaemonSet은 정상으로 보이는데 노드 계열 하나가 끝내 에이전트를 못 받음fleet에 새 노드 풀 이미지를 추가한 뒤, 다른 곳에서는 정상인 DaemonSet 하나가 그 노드들을 조용히 건너뜁니다.Kubernetes고급15분ProK8S-1392Gatekeeper 정책은 그대로인데 네임스페이스 하나가 admission에서 실패하기 시작컨트롤 플레인 업그레이드 후 같은 리소스 종류인데 admission 경로에 따라 정책 동작이 달라집니다.Kubernetes고급15분ProK8S-1399kube-proxy 대체 이전이 worker 노드에서는 되는데 컨트롤 플레인에 있는 daemonset 하나가 서비스 도달성을 잃음데이터플레인 이전으로 pod 트래픽은 좋아졌는데, 컨트롤 플레인 노드의 host-network 에이전트만 서비스 조회나 접근에 실패합니다.Kubernetes고급15분ProK8S-1357kubeadm worker join은 통과하는데 pod가 이미지를 pull하지 못함사설 mirror로 이전한 뒤 컨트롤 플레인 노드는 정상인데 새로 합류한 worker에서만 pod가 시작하지 못합니다.Kubernetes고급15분ProK8S-1355Kubernetes의 OpenSearch 클러스터가 yellow에 머무름zone label 이전을 배포했는데, 클러스터에 노드가 충분한데도 stateful 검색 레플리카가 계속 Pending입니다.Kubernetes고급15분ProLINUX-1304Logrotate는 성공한 것처럼 보이는데 고volume 서비스가 계속 줄을 잃음피크 트래픽 중 애플리케이션이 로그를 깔끔히 rotate하는데, 이후 rotate 시점 즈음에 조용한 공백이 있음을 발견합니다.Linux고급15분Pro