벤더문제 339개· 검수 문제 9개

AWS

AWS 환경에서 일어나는 장애 문제 339개를 모았습니다.

모든 문제 339개

CICD-228배포 파이프라인이 컨테이너 이미지는 서명하는데 정작 런타임 동작을 바꾸는 values 번들은 서명하지 않음 (failover 리허설 중)바이너리 아티팩트는 공급망 검사를 통과하는데 설정 아티팩트는 서명되지 않고 변경 가능한 채로 남습니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD고급19분ProCICD-111병렬 Terraform plan이 같은 원격 state 잠금 타임아웃에서 경합해, 두 번째 파이프라인이 낡은 전제로 apply변경 둘이 같은 workspace를 겨냥하고 하나가 lock을 기다리는데, 그것이 실행될 때쯤엔 상태가 이미 달라져 그 plan을 믿을 수 없습니다.CI/CD고급19분ProK8S-1256사설 EKS subnet의 pod가 ImagePullBackOff새 사설 노드 그룹이 EKS에 합류했는데, 이미지 참조와 노드 IAM role이 유효한데도 ECR에서 pull하는 워크로드만 실패하기 시작합니다.Kubernetes고급19분ProCICD-104이미지 승격이 manifest list는 복사하고 arm64 digest를 빠뜨려, 릴리스 후 노드 풀 하나만 실패승격된 태그는 레지스트리에서 유효해 보이는데 arm64 worker가 pull하지 못합니다 — 승격 중에 multi-arch 인덱스가 플랫폼별 자식 이미지를 잃었습니다.CI/CD고급19분ProCICD-476재사용 워크플로가 컨테이너 이미지를 제대로 서명하는데 하위 승격이 별도 저장소의 서명 안 된 digest를 다시 태깅 (강화된 baseline 배포 후)공급망 통제가 주 경로는 보호하는데 부수 승격 lane이 서명된 아티팩트를 우회합니다. 워크로드 설정은 그대로인데 갱신된 baseline이 하위 계층 의존성 하나를 더 공격적으로 해석합니다.CI/CD중급19분ProCICD-478재사용 워크플로가 컨테이너 이미지를 제대로 서명하는데 하위 승격이 별도 저장소의 서명 안 된 digest를 다시 태깅 (운영 소유권 이전 후)공급망 통제가 주 경로는 보호하는데 부수 승격 lane이 서명된 아티팩트를 우회합니다. 플랫폼은 계속 온라인인데 자동화나 런북 전제 하나가 소유권 이전을 견디지 못했습니다.CI/CD중급19분ProK8S-1243재스케줄 후 StatefulSet pod가 무한 재시작노드 이벤트 후 stateful 워크로드가 재스케줄되고, 이후 데이터 경로에서 권한 오류로 반복 실패합니다.Kubernetes고급19분ProK8S-1253재스케줄 후 StatefulSet 볼륨은 다시 붙는데 쓰기 접근이 계속 실패노드 장애 후 stateful 워크로드가 다른 노드에서 재시작하는데, 볼륨은 깔끔히 붙는데도 파일 권한에서 즉시 실패합니다.Kubernetes고급19분ProK8S-1238ingress route는 유효해 보이는데 hostname 하나가 계속 404ingress 컨트롤러를 추가하거나 업그레이드한 뒤, Ingress 객체 자체는 그대로인데 hostname 하나가 엉뚱한 응답을 반환하기 시작합니다.Kubernetes고급20분ProK8S-084maxUnavailable이, 이미 사용 불가 멤버가 하나 있는 taint 걸린 노드 그룹과 충돌해 DaemonSet 갱신이 멈춤업데이트 전략은 보수적으로 보이는데 롤아웃 진행이 멈춥니다 — taint된 그룹의 현재 불가용 상태가 이미 허용된 업데이트 예산을 넘었습니다.Kubernetes고급20분ProK8S-1250노드 그룹은 Ready가 되는데 일부 워크로드가 계속 실패EKS 클러스터에 새 노드 그룹이 합류했는데 거기 배치된 pod만 시작이나 네트워킹에서 실패하기 시작합니다.Kubernetes고급20분ProK8S-1245노드 그룹은 정상으로 보이는데 일부 pod가 계속 시작하지 못함EKS 클러스터에 새 노드 그룹이 합류했는데 새 인스턴스에 배치된 일부 워크로드만 실패하기 시작합니다.Kubernetes고급20분ProCICD-096롤백 정책이 ALB 5xx에 의존하는데 실패는 gRPC 상태 코드에만 보임릴리스가 불안정한데 롤백이 발동하지 않습니다 — 감시 신호가 이 서비스가 쓰는 애플리케이션 계층 실패 의미를 무시합니다.CI/CD고급20분ProK8S-1255새 노드 그룹은 Ready가 되는데 거기 있는 pod만 실패교체나 증설용 노드 그룹이 클러스터에 합류했는데 거기 배치된 워크로드만 시작이나 네트워킹에서 실패하기 시작합니다.Kubernetes고급20분ProCICD-536재사용 워크플로가 컨테이너 이미지를 제대로 서명하는데 하위 승격이 별도 저장소의 서명 안 된 digest를 다시 태깅 (강화된 통제 배포 후)공급망 통제가 주 경로는 보호하는데 부수 승격 lane이 서명된 아티팩트를 우회합니다. 워크로드는 거의 그대로인데 갱신된 컨트롤 플레인이 뒷받침 의존성 하나를 이전보다 엄격하게 평가합니다.CI/CD중급20분ProK8S-1227ALB 컨트롤러가 로드밸런서는 만드는데 타깃 등록이 실패Ingress 객체는 활성화되는데 등록 후에도 하위 타깃 health가 계속 빨간색입니다.Kubernetes고급21분ProK8S-1219ALB 컨트롤러는 권한이 맞다고 하는데 동작 하나가 계속 실패ALB 컨트롤러가 일부 리소스는 만들 만큼 동작하는데 조정 동작 하나에서 반복해 실패합니다.Kubernetes고급21분ProK8S-1221CoreDNS pod는 Running인데 질의가 계속 실패확장 후에도 CoreDNS는 Running인데, pod가 새 노드 그룹에 배치된 뒤에만 이름 해석이 실패합니다.Kubernetes고급21분ProK8S-1208노드는 이미 클러스터에서 Ready로 보이는데 관리형 노드 그룹은 합류 실패를 보고콘솔은 계속 실패를 보여주는데 kubectl은 Ready 노드를 보여줘서 팀이 엉뚱한 방향으로 원인을 찾습니다.Kubernetes고급21분ProCICD-039ECR 라이프사이클 정리가 승격 manifest가 아직 참조하는 digest를 삭제운영 승격 manifest는 불변 digest를 가리키는데 지연된 배포 구간이 시작되기 전에 레지스트리 정리가 유일한 사본을 지웁니다.CI/CD중급22분Pro