Rollout Stuck
‘Rollout Stuck’ 증상으로 나타나는 장애 문제 384개를 모았습니다.
먼저 읽을 가이드
추천 문제
모든 문제 384개
SECURITY-080엔드포인트 격리 정책이 EDR 클라우드 콜백을 막아 host가 봉쇄에서 끝내 복구되지 못함봉쇄는 제대로 시작되는데 host가 영구히 고립됩니다 — 정책이 안전하게 해제하는 데 필요한 제어 채널까지 끊었습니다.Security고급21분ProCICD-099이미지 서명은 CI에서 성공하는데 root 교체 후 admission 정책이 서명 발급자를 거부빌드는 서명된 이미지를 게시하는데 클러스터 admission이 실패합니다 — 검증기가 계속 옛 서명 root만 신뢰합니다.CI/CD고급21분ProCICD-085CloudFormation import는 성공하는데 이후 drift 복구가 수동으로 남긴 리소스를 교체하려 함import 후 스택은 안정되는데 이후 업데이트가 위험해집니다 — import된 리소스 형태가 아직 템플릿이 교체 가능하다고 전제하는 것과 다릅니다.CI/CD고급22분ProSECURITY-070EDR 격리가 로그 shipper 바이너리를 제거해 경보 없이 host 가시성이 사라짐한쪽 관점에서는 엔드포인트 agent가 제 일을 했는데 보안 운영이 telemetry를 잃습니다 — 격리된 구성 요소가 중앙 가시성으로 가는 유일한 경로이기도 했습니다.Security고급22분ProNETWORK-090EVPN MAC mobility는 감지되는데 dampening 타이머가 트래픽을 옛 leaf에 계속 고정컨트롤 플레인은 이동을 인지하는데 데이터가 계속 깨집니다 — mobility dampening이 새 위치 수용을 워크로드가 버틸 수 있는 시간보다 오래 지연시킵니다.Network고급22분ProK8S-068FailurePolicy Ignore 때문에 필수 보안 sidecar 없이 pod가 시작됨webhook 장애 중에도 클러스터는 계속 살아 있는데 나중에 운영 트래픽이 실패합니다 — 플랫폼이 전제하는 sidecar 계약 없이 워크로드가 떴습니다.Kubernetes고급22분ProCICD-093Terraform drift 수정이 canary 타깃 그룹 route를 아직 담고 있는 subnet을 교체plan은 교정처럼 보이는데 적용하면 라이브 트래픽이 끊깁니다 — 낡았다던 서브넷 하나가 아직 활성 canary 경로를 붙잡고 있습니다.CI/CD고급22분ProCICD-073Terraform plan은 안전해 보이는데 for_each 키 이름 변경 후 apply가 IAM role을 다시 만듦검토에서는 뚜렷한 파괴적 변경이 보이지 않는데 apply가 활성 role을 교체합니다 — 리팩터 중 for_each가 쓰는 안정 키가 바뀌었습니다.CI/CD고급22분ProLINUX-085XFS 메타데이터 손상 경고는 오래된 것인데 당직자가 마운트된 볼륨에 파괴적 repair를 계획장애 중 옛 경보가 재등장하는데, 이제 진짜 위험은 운영자의 조치입니다 — 파일시스템이 아직 마운트된 채 운영 쓰기를 처리하고 있습니다.Linux고급22분ProK8S-076복제 복구 테스트 후 VolumeSnapshot 복원이 엉뚱한 PVC 계보에 바인딩됨스냅샷 데이터는 유효한데 이후 복원이 엉뚱한 기대 체인에 붙습니다 — 테스트 중에 스냅샷 내용과 클론 이름을 너무 대충 재사용했습니다.Kubernetes고급22분ProK8S-028장수 연결 pod에서 노드 drain이 멈춤점검은 제대로 시작되는데 축출이 끝나지 않습니다 — 연결 draining과 종료 훅이 너무 오래 걸립니다.Kubernetes중급22분ProCICD-063교차 계정 백엔드에서 죽은 apply 뒤에도 Terraform 원격 state 잠금이 살아남음실패한 apply에 더는 활성 프로세스가 없는데도 이후 모든 실행이 잠금에서 멈춥니다 — 백엔드 정리 경로가 계정 간에 끝까지 완료되지 않았습니다.CI/CD고급23분ProK8S-062노드 상실 후 오래된 VolumeAttachment 객체가 PVC 재연결을 막음대체 노드는 준비됐는데 워크로드가 볼륨을 마운트하지 못합니다 — 스토리지 컨트롤 경로가 아직 옛 attach가 살아 있다고 믿습니다.Kubernetes고급23분ProCICD-008스모크 테스트 조건문이 잘못되어 검증 없이 배포가 통과되는 문제조건부 실행 규칙이 잘못되어 가장 중요한 검증 단계가 건너뛰어지는 사고를 추적합니다.CI/CD고급23분ProCICD-083스키마 마이그레이션이 writer에서는 성공하는데 read replica가 canary 트래픽에 계속 호환되지 않는 형태를 서빙마이그레이션 로그는 성공으로 보이는데 canary가 계속 실패합니다 — 복제 지연 때문에 일부 트래픽이 옛 스키마 경로를 읽습니다.CI/CD고급23분ProCICD-071앱 경계를 너무 넓게 잡아 Argo CD prune이 공유 secret을 삭제동기화 자체는 성공하는데 정리 단계가 다른 워크로드가 아직 의존하는 namespace 범위 secret을 지웁니다 — 소유권 경계가 안전하게 표현되지 않았습니다.CI/CD고급23분ProCICD-080의존하는 스키마 변경이 모든 shard에 닿기 전에 기능 플래그 마이그레이션 단계가 실행롤아웃 스크립트는 중앙에서는 성공하는데 샤드 하나가 아직 옛 스키마를 쓰고 새 플래그 경로가 아직 모든 곳에 없는 컬럼을 부르기 시작합니다.CI/CD고급23분ProK8S-071AZ 장애 후 PodDisruptionBudget과 topology spread가 합법적인 복구 배치를 남기지 않음장애 전에는 워크로드에 replica가 충분했는데 zone 하나가 사라진 뒤 남은 규칙들 때문에 모든 복구 선택지가 분산이나 disruption 보장 중 하나를 어깁니다.Kubernetes고급24분ProCICD-075blue-green 노드 그룹 전환이 대체 경로가 준비되기 전에 유일한 로그 shipper를 drain새 노드는 앱 입장에서는 정상인데 운영 가시성이 사라집니다 — 대체 fleet이 완전히 붙기 전에 drain 순서가 클러스터 전역 DaemonSet을 걷어냈습니다.CI/CD고급24분ProCICD-090canary bake 시간이 큐 가시성 창보다 짧아 실패 신호가 승격 후에 도착롤아웃은 bake 단계를 통과하는데 숨은 worker 실패가 큐 타임아웃 구간이 지난 뒤, 트래픽이 완전히 넘어가고 한참 뒤에야 드러납니다.CI/CD고급24분Pro