Rollout Stuck
‘Rollout Stuck’ 증상으로 나타나는 장애 문제 384개를 모았습니다.
먼저 읽을 가이드
추천 문제
모든 문제 384개
CICD-133blue-green DNS 전환은 성공했는데 CDN origin 고정이 옛 백엔드에 남아 트래픽 일부가 끝내 옮겨가지 않음authoritative 이름은 제대로 가리키는데 상류에 캐시된 origin 메타데이터가 사용자를 폐기된 스택에 계속 붙잡아 둡니다.CI/CD고급18분ProCICD-155blue-green 전환이 공개 ALB 타깃 그룹은 갱신했는데 내부 서비스 디스커버리가 계속 blue 스택으로 해석돼 백그라운드 작업이 거기에 계속 씀정문은 깔끔히 옮겨졌는데 내부 호출자는 이전 환경에 그대로 남습니다 — 다른 디스커버리 소스를 씁니다.CI/CD고급18분ProNETWORK-086IP SLA가 엉뚱한 probe 대상을 추적해, 애플리케이션이 멀쩡한 장애 중에 주 경로를 철회failover는 설정한 대로 정확히 발동하는데, 선택된 probe 대상이 실제 애플리케이션 health를 대표하지 않아 불필요한 라우팅 전환을 일으킵니다.Network고급18분ProNETWORK-089OSPF 인접은 형성되는데 area 타입 불일치로 지사 route에 필요한 LSA가 억제됨이웃 상태는 맞아 보이는데 기대한 route가 끝내 나타나지 않습니다 — 한쪽이 area를 다르게 취급해 핵심 LSA 전파를 걸러 냅니다.Network고급18분ProLINUX-100일시적 스토리지 오류 후 파일시스템이 읽기 전용으로 다시 마운트되는데 앱이 그것을 일반 500으로 감춤애플리케이션 로그는 시끄러운데 진짜 원인은 앱이 명확히 드러내지 않는 I/O 오류 뒤 커널이 파일시스템을 읽기 전용으로 다시 마운트한 것입니다.Linux고급18분ProCICD-204blue-green 전환이 공개 ingress는 옮겼는데 내부 서비스 디스커버리는 직전 스택에 남음 (failover 리허설 중)공개 트래픽은 깔끔히 옮겨가는데 배치나 백엔드 호출자가 계속 옛 environment에 씁니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD고급19분ProNETWORK-093OSPF 인접은 full로 유지되는데 summary route가 정책 라우팅에 필요한 더 구체적인 경로를 가림프로토콜은 정상인데 애플리케이션 경로가 실패합니다 — 경로 요약이 정책 로직이 의존하는 특정 목적지를 가립니다.Network고급19분ProCICD-079가변 이미지 태그 때문에 ECS 롤백이 실패한 릴리스보다 더 새로운 빌드를 pull롤백 로직은 이전 task definition을 가리키는데 서비스가 계속 엉뚱한 컨테이너를 띄웁니다 — 두 리비전이 같은 가변 이미지 태그를 참조합니다.CI/CD고급19분ProCICD-091릴리스 manifest가 스테이징 registry에만 있는 digest를 가리킴승격 메타데이터는 유효해 보이는데 운영이 이미지를 pull하지 못합니다 — 참조된 digest가 대상 레지스트리로 복제된 적이 없습니다.CI/CD고급19분ProCICD-078canary 분석이 판단해야 할 origin 트래픽 대신 캐시된 CDN 응답을 상대로 통과메트릭상 롤아웃은 정상으로 보이는데 분석이 캐시 적중 동작을 읽고 있습니다 — 승격 후 사용자가 실제로 지나갈 새 origin 경로가 아닙니다.CI/CD고급20분ProLINUX-077numeric-ids로 Rsync 복원하자 대상 host가 사용자를 다르게 매핑해 파일 소유권이 어긋남백업은 멀쩡해 보이는데 복원된 애플리케이션이 접근을 잃습니다 — 숫자 UID 보존이 더는 대상 시스템 계정 구조와 맞지 않습니다.Linux고급20분ProCICD-069OIDC 배포 role이 push 이벤트에서는 되고 workflow_call 재사용에서 실패직접 push에서는 저장소가 이미 잘 배포되는데 재사용 워크플로 경로가 이제 실패합니다 — 토큰 subject 패턴이 호출 컨텍스트와 더 이상 맞지 않습니다.CI/CD고급20분ProLINUX-068systemd-coredump가 반복 크래시 덤프를 계속 쌓아 tmpfs 기반 런타임 경로가 참서비스 장애가 단순한 재시작 루프처럼 보이는데, 더 깊은 문제는 제한된 tmpfs 경로에 반복 생성되는 큰 coredump가 만드는 런타임 스토리지 압박입니다.Linux고급20분ProK8S-090노드 재부팅 폭풍 후 CSI node 플러그인은 정상인데 볼륨 마운트가 실패Kubernetes고급20분ProCICD-089다중 계정 배포 role이 파이프라인 계정은 신뢰하는데 위임된 tooling role의 세션 이름 패턴은 신뢰하지 않음교차 계정 배포가 이전에는 됐는데 이제 실패합니다 — 신뢰 정책이 출발 계정은 허용하면서 실제 위임 세션 신원 형식을 거부합니다.CI/CD고급20분ProK8S-097CSI 스냅샷 복원은 끝났는데 파일시스템 UUID 충돌이 부트스트랩 스크립트를 혼란시킴스토리지는 다시 온라인인데 앱이 계속 실패합니다 — 복원된 파일시스템 신원이 시작 로직이 고유하다고 여기는 값과 충돌합니다.Kubernetes고급21분ProCICD-065ECR 라이프사이클 정리가 아키텍처 이미지 하나를 삭제해 arm 노드에서 pull이 실패하기 시작저장소에는 기대한 태그가 그대로 있는데 한 플랫폼에서 멀티 아키텍처 pull이 깨집니다 — manifest list가 이미 만료된 자식 이미지를 가리킵니다.CI/CD고급21분ProK8S-086로컬 ephemeral-storage 요청이 모든 노드 템플릿을 넘어 Cluster Autoscaler가 pending pod를 무시pod가 pending에 머물고 오토스케일링도 반응하지 않습니다 — 요청한 로컬 스토리지 프로파일이 확장 그룹의 어떤 노드 형태에도 맞지 않습니다.Kubernetes고급21분ProCICD-087롤백 Lambda는 성공하는데 Auto Scaling warm pool이 계속 실패한 launch template을 서빙롤백 경로가 그룹을 갱신하는데 인스턴스가 계속 깨진 버전으로 뜹니다 — warm capacity 풀이 예전 템플릿 상태를 유지했습니다.CI/CD고급21분ProCICD-076리전 간 아티팩트 복제가 지연돼 재해 복구 배포가 부분 릴리스를 사용주 리전에서는 승격이 끝났는데 DR 환경이 불완전한 artifact 집합을 받습니다 — 의존 객체가 다 도착하기 전에 manifest 복제가 끝났습니다.CI/CD고급21분Pro