AWS
AWS 환경에서 일어나는 장애 문제 339개를 모았습니다.
먼저 읽을 가이드
추천 문제
모든 문제 339개
CICD-1388canary 릴리스가 자동 승격되고도 롤백점진적 배포를 요청률 메트릭 기준으로 조정한 뒤, 스케일 이벤트 후 스스로 롤백하기 시작합니다.CI/CD고급15분ProCICD-1368ECS blue-green 롤아웃이 트래픽을 승격했는데 고객 코호트 하나가 계속 옛 task set에 걸림blue-green 배포가 성공한 것으로 보이는데 일부 사용자가 전환 후로도 한참 옛 버전 동작을 계속 봅니다.CI/CD고급15분ProCICD-1350ECS blue-green 배포가 깨끗해 보이는데 옛 task set이 트래픽 일부를 계속 서빙플랫폼 팀이 blue-green 승격을 자동화했는데, 배포 컨트롤러는 성공을 보고하면서 사용자 동작이 섞여 나타납니다.CI/CD고급15분ProCICD-1398ECS blue-green 배포가 트래픽 일부를 옛 task set에 계속 둠완료된 듯한 blue-green 롤아웃이 승격 후로도 한참 일부 사용자를 직전 버전으로 보냅니다.CI/CD고급15분ProCICD-1358ECS blue-green 배포는 정상이라고 보고하는데 사용자 세션이 계속 깨짐blue-green 롤아웃은 운영상 성공했는데 트래픽 가중치가 바뀐 뒤로도 일부 인증 사용자가 계속 옛 버전과 통신합니다.CI/CD고급15분ProK8S-1335EKS 워크로드는 AWS API에 닿는데 secret 조회 하나가 계속 실패다중 클러스터 플랫폼이 secret 동기화 방식을 하나로 표준화했는데, EKS 클러스터 계열 하나만 AWS 기반 secret 조회에 실패합니다.Kubernetes고급15분ProCICD-1330배포 health 게이트는 성공을 보고하는데 서비스가 계속 롤백blue-green 배포 구성이 자동 검사를 모두 통과하는데도, 승격된 대상에 사용자 트래픽이 닿자 롤백이 발생합니다.CI/CD고급15분ProK8S-1263ALB 타깃 그룹이 계속 unhealthy구조적 장애 대응 훈련용 K8s 장애 시나리오입니다.Kubernetes고급16분ProK8S-1262Cluster autoscaler가 스케줄 불가 pod를 보면서도 확장하지 않음구조적 장애 대응 훈련용 K8s 장애 시나리오입니다.Kubernetes고급16분ProCICD-1304DynamoDB에서 원격 state 잠금이 해제된 것으로 보이는데 다음 plan이 계속 실행을 거부중단된 배포가 잠금 테이블은 풀었는데 이후 실행이 계속 잠금 형태의 오류로 진행을 거부합니다.CI/CD고급16분ProK8S-1309EKS 애드온 갱신은 깨끗해 보이는데 새 pod가 IP를 받지 못함네트워크 애드온은 정상이라고 보고하는데 노드 그룹을 확장하거나 업그레이드하자 pod 밀도가 갑자기 줄어듭니다.Kubernetes고급16분ProCICD-1312GitHub 배포가 OIDC로 성공했는데 Terraform이 계속 실패팀이 OIDC로 이전했는데 워크플로 경로 하나에서만 Terraform이 계속 옛 IAM principal처럼 동작합니다.CI/CD고급16분ProCICD-1303Terraform init은 성공하는데 apply가 실패팀이 공유 자격 증명 로직을 리팩터한 뒤, init과 state refresh는 계속 되는데 apply만 실패합니다.CI/CD고급16분ProCICD-357재사용 워크플로가 컨테이너 이미지를 제대로 서명하는데 하위 승격이 별도 저장소의 서명 안 된 digest를 다시 태깅 (단계적 폐기 중)공급망 통제가 주 경로는 보호하는데 부수 승격 lane이 서명된 아티팩트를 우회합니다. 주 경로로는 서비스가 계속 되고, 옛 구성 요소가 완전히 빠질 때만 의존성 하나가 실패합니다.CI/CD중급16분ProK8S-1273cluster autoscaler가 pending pod를 보고도 스케일을 거부노드를 더 늘리면 해결돼야 하고 autoscaler 배포도 정상으로 보이는데 taint 걸린 워크로드가 계속 Pending입니다.Kubernetes고급17분ProK8S-1279external-dns 갱신은 성공한 듯한데 사용자가 계속 엉뚱한 로드밸런서에 도달클러스터 이전으로 DNS를 바꿨는데 자동화 파이프라인은 성공을 보고하고 실제 트래픽은 계속 옛 엔드포인트로 해석합니다.Kubernetes고급17분ProK8S-1305Grafana Loki가 로그는 읽는데 새 경보를 계속 놓침로그 플랫폼을 객체 스토리지로 이전했는데, 자격 증명과 버킷은 유효해 보이면서 알림이 불안정해집니다.Kubernetes고급17분ProCICD-158IaC drift 탐지기가 태그만 다른 차이를 무시하는데, 빠진 그 태그가 SCP 예외를 좌우해 다음 배포가 운영에서만 실패인프라는 형태상 동등해 보이는데 거버넌스와 관련된 태그 하나가 허용 동작을 바꿨습니다.CI/CD고급17분ProK8S-1299ingress 컨트롤러 pod는 정상인데 타깃 그룹이 끝내 갱신되지 않음컨트롤러 차트를 업그레이드한 뒤 pod는 정상인데 ingress 상태가 더는 조정되지 않습니다.Kubernetes고급17분ProK8S-1297IRSA role이 한 네임스페이스에서는 되고 다른 곳에서 실패차트를 업그레이드한 뒤, 같은 role을 쓰는 다른 네임스페이스는 정상인데 하나만 AWS API 접근을 잃습니다.Kubernetes고급17분Pro