벤더문제 339개· 검수 문제 9개

AWS

AWS 환경에서 일어나는 장애 문제 339개를 모았습니다.

모든 문제 339개

K8S-1258HPA가 메트릭 unknown에 머무름팀이 오토스케일링을 켠 뒤, 겉보기엔 정상인 deployment에서 CPU나 메모리 메트릭이 끝내 채워지지 않습니다.Kubernetes중급16분ProK8S-1274Metrics Server는 설치됐는데 HPA가 계속 눈이 멈Metrics Server를 설치하고 pod도 정상으로 보이는데 HPA가 계속 메트릭 unknown에 머무릅니다.Kubernetes중급16분ProK8S-1280Service가 클러스터 내부에서는 되는데 NLB 트래픽이 실패LoadBalancer Service가 클러스터 안에서는 완벽한데 NLB 출발지 보존이 끼어들자 외부 클라이언트에서만 실패합니다.Kubernetes중급16분ProCICD-1284배포 작업이 이미지는 push할 수 있는데 registry 캐시는 갱신하지 못함팀이 registry 기반 Buildx 캐싱을 추가한 뒤, 일반 push는 되는데 캐시 단계만 실패하기 시작합니다.CI/CD중급16분ProCICD-369프리뷰 environment가 운영 기본값의 기능 플래그를 써서, 운영 롤아웃이 그 경로를 켤 때까지 빠진 secret 하나를 숨김 (단계적 폐기 중)위험한 경로가 거기서는 활성화된 적이 없어서 하위 환경이 깨끗해 보였을 뿐입니다. 주 경로로는 서비스가 계속 되고, 옛 구성 요소가 완전히 빠질 때만 의존성 하나가 실패합니다.CI/CD중급16분ProK8S-1257EKS ingress가 pending에 머무름컨트롤러도 설치돼 있고 권한도 있는데 ingress나 LoadBalancer Service가 끝내 프로비저닝되지 않습니다.Kubernetes중급17분ProK8S-1260Service가 앱을 노출하는데 외부 트래픽이 계속 실패LoadBalancer Service는 잘 생성되는데 하나 이상의 노드에서 타깃 health가 계속 빨간색입니다.Kubernetes중급17분ProK8S-357노드 복구 후 PersistentVolume은 다시 붙는데 애플리케이션이 failover 전에 쓰던 옛 node-local 헬퍼 경로를 계속 고정 (단계적 폐기 중)볼륨은 정상인데 워크로드가 계속 이전 노드의 host 로컬 상태를 참조합니다. 주 경로로는 서비스가 계속 되고, 옛 구성 요소가 완전히 빠질 때만 의존성 하나가 실패합니다.Kubernetes고급17분ProK8S-393다중 클러스터 failover 레코드는 제대로 갱신되는데 HTTP/2 연결 하나에 고정된 클라이언트가 새 백엔드 집합을 끝내 재발견하지 못함 (단계적 폐기 중)이름 해석은 수렴하는데 장수 스트림이 옛 세계를 살려 둡니다. 주 경로로는 서비스가 계속 되고, 옛 구성 요소가 완전히 빠질 때만 의존성 하나가 실패합니다.Kubernetes고급17분ProCICD-192아티팩트 보존 작업이 이미지는 남기고 분리된 attestation을 제거 (failover 리허설 중)주 artifact는 계속 쓸 수 있는데 admission이나 provenance 검사가 의존하는 증빙을 잃습니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD중급17분ProK8S-137외부 로드밸런서 health check가 readiness 게이팅이 유효해지기 전에 NodePort를 때려, 실사용 가능한 백엔드 없이 노드가 로테이션에 들어감인프라에는 포트가 열린 것으로 보이는데 애플리케이션은 아직 트래픽을 처리할 준비가 되지 않았습니다.Kubernetes고급17분ProCICD-276인증서 검증 작업이 옛 hostname을 아직 probe 중인데 프리뷰 environment 해체가 DNS를 먼저 제거 (failover 리허설 중)환경 수명주기 정리는 비용 관점에서는 맞는데 남은 검증 경로에는 너무 이릅니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD중급17분ProCICD-294패키지 provenance 검사가 tarball 하나를 검증하는 사이 배포 단계는 mirror에서 재포장된 아카이브를 소비 (failover 리허설 중)소스 아티팩트는 공급망 검사를 통과하는데 런타임 경로가 검증된 적 없는 파생 아카이브를 씁니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD중급17분ProCICD-306프리뷰 배포는 더 낮은 권한 신원으로 로그인하는데 이후 승격 단계가 같은 자격 증명이 그대로 충분하다고 가정 (failover 리허설 중)앞단 환경은 되는데 승격 경로에는 파이프라인이 갱신하지 않는 더 넓은 scope가 필요합니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD중급17분ProK8S-1235init 작업이 권한은 고치는데 주 컨테이너가 계속 실패CSI 마운트와 init 로직의 상대적 타이밍에 따라 pod가 어떤 재시작에서는 성공하고 어떤 때는 실패합니다.Kubernetes중급18분ProK8S-264source-range 규칙이 노드 주소를 신뢰하는데 externalTrafficPolicy Local이 zone 하나에 유효한 ingress 경로를 남기지 않음 (failover 리허설 중)로드밸런서 정책은 맞는데 locality가 실제로 트래픽을 받을 수 있는 노드를 바꿉니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.Kubernetes고급18분ProK8S-123복원된 PersistentVolume이 옛 zone의 node affinity를 유지해 대체 pod가 새 리전 구간에서 끝내 마운트하지 못함스토리지 측면에서는 복원이 성공했는데 스케줄링과 attach 로직이 계속 원본 토폴로지를 반영합니다.Kubernetes고급18분ProCICD-222승격 규칙이 시맨틱 버전 메타데이터를 신뢰하는데 mirror 동기화가 빌드 메타데이터를 다시 씀 (failover 리허설 중)릴리스 artifact는 버전 label을 유지하는데 미러 경로가 하위 게이트 하나가 아직 쓰는 메타데이터 필드를 바꿉니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD고급18분ProCICD-487프리뷰 environment가 운영 기본값의 기능 플래그를 써서, 운영 롤아웃이 그 경로를 켤 때까지 빠진 secret 하나를 숨김 (정책 상속 정리 후)위험한 경로가 거기서는 활성화된 적이 없어서 하위 환경이 깨끗해 보였을 뿐입니다. 명시 설정은 맞아 보이는데 상속된 정책이 정리된 계층에서 다르게 해석됩니다.CI/CD중급18분ProCICD-547프리뷰 environment가 운영 기본값의 기능 플래그를 써서, 운영 롤아웃이 그 경로를 켤 때까지 빠진 secret 하나를 숨김 (관리자 계층 평탄화 후)위험한 경로가 거기서는 활성화된 적이 없어서 하위 환경이 깨끗해 보였을 뿐입니다. 명목상 접근은 맞아 보이는데 위임 경로 하나가 계속 이전의 계층화된 관리 모델을 반영합니다.CI/CD중급19분Pro