벤더문제 339개· 검수 문제 9개

AWS

AWS 환경에서 일어나는 장애 문제 339개를 모았습니다.

모든 문제 339개

CICD-1281재사용 워크플로가 한 저장소에서는 OIDC 토큰을 발급받고 다른 곳에서 실패배포 파이프라인을 공유 워크플로로 리팩터한 뒤 저장소 하나만 클라우드 role을 assume하지 못합니다.CI/CD고급17분ProCICD-351blue-green 전환이 HTTP health는 검증하는데 백그라운드 lease 보유자가 계속 폐기 중인 환경을 가리킴 (단계적 폐기 중)정문은 정상인데 숨은 소유권 경로가 엉뚱한 쪽에서 상태를 계속 바꿉니다. 주 경로로는 서비스가 계속 되고, 옛 구성 요소가 완전히 빠질 때만 의존성 하나가 실패합니다.CI/CD고급18분ProCICD-1289canary 배포 health check가 계속 빨간색애플리케이션 코드와 롤아웃 로직은 그대로인데, 클러스터나 인증 의존성을 업그레이드한 뒤에만 canary 배포가 실패하기 시작합니다.CI/CD고급18분ProCICD-100canary 트래픽은 제대로 옮겨지는데 레거시 cron 노드가 옛 작업 이미지를 계속 별도로 실행서비스 경로는 승격된 것처럼 보이는데 백그라운드 job이 아직 옛 릴리스로 동작합니다 — 스케줄러 풀이 롤아웃 범위에 포함되지 않았습니다.CI/CD고급18분ProK8S-1232CoreDNS pod는 정상인데 네임스페이스 하나가 계속 해석에 실패노드 로컬 DNS 최적화나 애드온 변경 후, 클러스터 나머지는 정상인데 강화된 네임스페이스만 이름 해석을 잃습니다.Kubernetes고급18분ProCICD-122Cosign 검증은 공개 digest에서 성공하는데 배포는 다른 manifest를 서빙하는 사설 mirror에서 pull빌드 중 공급망 검사는 통과하는데 런타임 아티팩트가 서명된 그것이 아닙니다 — mirror가 digest 대상을 다시 씁니다.CI/CD고급18분ProCICD-1265Docker 빌드는 push에 성공했는데 이후 pull이 실패구조적 장애 대응 훈련용 CI/CD 장애 시나리오입니다.CI/CD고급18분ProCICD-1270Docker 빌드는 push에 성공했는데 이후 pull이 실패registry를 이전했는데 런타임 host가 아직 옛 registry에 로그인돼 있어, CI는 초록인 채로 운영 배포가 실패하거나 예상 밖의 이미지를 pull합니다.CI/CD고급18분ProK8S-312externalTrafficPolicy Local 설계는 맞는데 오토스케일된 zone 하나에 일시적으로 로컬 endpoint가 없고 로드밸런서가 계속 거기로 트래픽을 보냄 (failover 리허설 중)트래픽 정책과 스케일링 타이밍이 함께 일시적 블랙홀을 만듭니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes고급18분ProCICD-312IaC 검증 단계가 태그만의 drift를 무시하는 사이 규정 준수 컨트롤러는 그 태그로 이후 런타임 변경을 허용·거부 (failover 리허설 중)인프라 형태는 기대와 맞는데 거버넌스 동작은 그렇지 않습니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD고급18분ProK8S-1259ingress 컨트롤러는 시작되는데 health check가 계속 실패ingress 컨트롤러가 AWS 리소스 일부는 만들다가, 배치 전제가 실제로 충족되지 않아 반복 실패하거나 요동칩니다.Kubernetes고급18분ProK8S-125kubelet 자격 증명 provider 캐시가 노드의 클라우드 신원 갱신보다 먼저 만료돼, 몇 시간 뒤에야 사설 registry pull이 실패부팅 직후 새 pod는 잘 도는데 이후 이미지 pull이 깨집니다 — 자격 증명 수명주기 둘이 갈립니다.Kubernetes고급18분ProK8S-1275pod는 정상적으로 스케줄되는데 영구 IP 할당을 잃음컴퓨트 관점에서는 여유로워 보이는 노드에서 pod가 네트워킹 오류로 시작하지 못하기 시작합니다.Kubernetes고급18분ProK8S-1264pod의 이름 해석이 간헐적으로 실패구조적 장애 대응 훈련용 K8s 장애 시나리오입니다.Kubernetes고급18분ProK8S-1269pod의 이름 해석이 간헐적으로 실패대시보드상 클러스터 DNS는 초록인데, 특정 노드의 앱 pod가 서비스나 외부 이름 해석에서 계속 타임아웃합니다.Kubernetes고급18분ProK8S-1261private EKS 클러스터에서 CoreDNS가 Pending에 머무름구조적 장애 대응 훈련용 K8s 장애 시나리오입니다.Kubernetes고급18분ProK8S-1266private EKS 클러스터에서 CoreDNS가 Pending에 머무름클러스터 확장이 성공한 듯한데 노드 등록은 정상인 채로 CoreDNS 등 필수 pod가 Pending에 머무릅니다.Kubernetes고급18분ProK8S-1271StatefulSet이 계속 재스케줄되는데 pod가 Pending에 머무름잘 스케줄되던 stateful 워크로드가 노드 그룹이나 AZ 토폴로지 변경 후 Pending에 갇힙니다.Kubernetes고급18분ProCICD-147Terraform destroy plan이 올바른 워크스페이스를 대상으로 하는데 provider alias 해석이 바뀌어 plan이 공유 서비스 계정을 가리킴리뷰어는 기대한 스택을 봤는데 런타임 provider 배선이 실제 영향 범위를 바꿨습니다.CI/CD고급18분ProCICD-128Terraform plan 파일을 한 provider 플러그인 버전으로 만들고 다른 버전으로 apply해 예상치 못한 드리프트 오류가 남변경은 제대로 리뷰됐는데 저장된 plan이 apply 시점의 provider 동작과 더 이상 맞지 않습니다.CI/CD고급18분Pro