증상문제 384개· 검수 문제 9개

Rollout Stuck

‘Rollout Stuck’ 증상으로 나타나는 장애 문제 384개를 모았습니다.

모든 문제 384개

CICD-060Terraform PR plan은 초록인데 main apply가 다른 변수 집합을 사용리뷰어는 plan 출력을 신뢰하는데 운영 apply가 다르게 동작합니다 — PR 단계는 한 워크스페이스와 tfvars 경로를 읽고 main 브랜치 apply는 다른 것을 씁니다.CI/CD고급29분ProK8S-029컨트롤러 재시작 후에야 CSI 드라이버가 볼륨 attach를 복구컨트롤러를 재시작할 때까지 영구 볼륨 attachment가 멈춰, 비정상 조정 루프를 가리킵니다.Kubernetes고급29분ProLINUX-119fstab automount가 첫 고객 요청이 그 경로를 때릴 때까지 진짜 마운트 실패를 가림부팅은 깨끗해 보이는데 장애가 나중에 시작됩니다 — 실패하는 의존성이 온디맨드 마운트 뒤로 미뤄집니다.Linux중급15분ProLINUX-102Journal rate limit이 진짜 크래시 패턴을 억눌러 팀이 엉뚱한 프로세스를 쫓음journal quota가 장애 구간에 반복되는 오류 신호를 버려 운영자에게 로그가 몇 줄만 보입니다.Linux중급15분ProNETWORK-130NetFlow exporter가 관리 VRF의 source 인터페이스를 쓰는데 collector가 운영 경로의 레코드를 받지 못함트래픽 포워딩은 멀쩡한데 telemetry가 먹통입니다 — export 패킷이 수집기 경로와 다른 라우팅 도메인에 있습니다.Network중급15분ProCICD-003검증 없는 프로덕션 배포 파이프라인에 승인 단계 추가하기환경별 배포 경계를 두고 승인 플로우와 스테이징 검증 절차를 설계하는 템플릿형 문제입니다.CI/CD입문15분ProCICD-120릴리스 노트 자동화가 시맨틱 버전 태그를 prerelease suffix로 다시 써 하위 승격 로직이 아티팩트를 거부배포된 artifact는 있는데 승격 컨트롤러가 거부합니다 — 계산된 버전 문자열이 기대한 stable 패턴과 더 이상 맞지 않습니다.CI/CD고급15분ProLINUX-393애플리케이션은 유니코드 파일명을 제대로 쓰는데 백업·동기화 서비스가 계속 옛 locale로 실행돼 경로 집합 일부를 버림 (단계적 폐기 중)시스템은 파일을 저장하는데 예약 경로 하나가 그것들을 다 보지 못합니다. 주 경로로는 서비스가 계속 되고, 옛 구성 요소가 완전히 빠질 때만 의존성 하나가 실패합니다.Linux중급15분ProLINUX-092커널 파라미터를 sysctl.d에서 조정했는데 사전순 때문에 앞선 파일이 이김원하는 설정이 디스크에는 있는데 호스트가 다른 값을 씁니다 — sysctl 로드 순서상 앞이나 뒤의 파일이 덮어씁니다.Linux고급15분ProK8S-119mutating webhook이 완료된 Job에도 sidecar를 주입해 정리 컨트롤러가 이미 끝난 pod에서 루프플랫폼 팀이 주입을 전역으로 켰는데 배치 워크로드의 정리가 실패하기 시작합니다 — 완료된 pod가 더 이상 컨트롤러의 가정과 맞지 않습니다.Kubernetes고급16분ProLINUX-121systemd tmpfiles 정리 규칙이 유휴 서비스 소켓 디렉터리를 제거해, 부팅 한참 뒤 다음 연결부터 실패하기 시작호스트는 안정적으로 보이다가 기간 기반 정리 작업이 애플리케이션이 남아 있길 기대한 경로를 지웁니다.Linux고급16분ProLINUX-330로그인 셸은 한 locale을 export하는데 비대화형 서비스 unit은 다른 것을 물려받아 같은 host 안에서 소수점 파싱이 갈림 (failover 리허설 중)전역적으로 틀린 건 없고, environment 계약이 실행 모드에 따라 다를 뿐입니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Linux중급16분ProCICD-210릴리스 예외는 승인되는데 그 감사 증거가 끝내 아카이브에 닿지 않음 (failover 리허설 중)당장은 운영을 이어갈 수 있는데 왜 그랬는지에 대한 거버넌스 기록이 불완전합니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD중급16분ProK8S-094멈춘 Job 하나가 끝내 종료 상태에 도달하지 않아 CronJob concurrency 정책이 모든 실행을 건너뜀일정은 맞는데 새 작업이 시작되지 않습니다 — 이전 Job이 종료 상태가 아니어서 concurrency 가드를 영원히 막습니다.Kubernetes고급16분ProNETWORK-128번호 재지정 후 IPv6 ND 검사가 오래된 바인딩을 유지해, 새 주소를 받은 host가 access edge에서 트래픽을 못 보냄보안은 켜진 채인데 주소 수명주기 전제가 번호가 다시 매겨진 endpoint 상태보다 뒤처집니다.Network중급16분ProNETWORK-147스택 멤버 교체가 running config는 보존했는데 MACsec용 신뢰 장치 목록이 startup에만 저장돼 재부팅 후 보안 링크가 끝내 돌아오지 않음필수 재부팅이, 보안 의존성이 두 설정 상태 모두에 복원되지 않았음을 드러내기 전까지는 운영이 괜찮아 보입니다.Network중급16분ProK8S-143CSI 스냅샷 복원은 성공했는데 애플리케이션 pod가 남아 있는 volumeClaimTemplate 참조를 통해 계속 옛 PVC 이름을 마운트데이터 복구는 끝났는데 워크로드 복구가 계속 사고 이전 스토리지 객체를 가리킵니다.Kubernetes고급17분ProLINUX-143dracut 재생성은 성공했는데 host가 직전 initramfs 경로를 가리키는 오래된 UEFI 항목으로 부팅복구 artifact는 있는데 펌웨어가 그것을 로드하지 않습니다.Linux고급17분ProK8S-157pod 재시작 예산은 정상인데 cluster autoscaler가 로컬 PV affinity를 만족하는 유일한 노드를 제거해 대체 pod가 재스케줄되지 못함용량은 남아 있는데 스토리지 지역성이 복구를 더는 존재하지 않는 노드에 계속 고정합니다.Kubernetes고급17분ProK8S-118PodDisruptionBudget의 healthy 수는 충족돼 보이는데 종료 중인 unready pod 때문에 drain이 계속 막힘종료 중인 pod가 어떤 상태에서는 집계되고 다른 상태에서는 제외돼 disruption 계산을 혼란시켜 점검이 끝나지 못합니다.Kubernetes고급17분Pro