AWS
AWS 환경에서 일어나는 장애 문제 339개를 모았습니다.
먼저 읽을 가이드
추천 문제
모든 문제 339개
SECURITY-075SCP가 복구 서비스는 허용하면서 복원 중 의존하는 KMS 복호화 호출을 차단장애 대응 플레이북은 제대로 시작하는데 복원이 계속 실패합니다 — 조직 정책이 서비스가 실제로 필요로 하는 하위 KMS 권한을 빠뜨렸습니다.Security고급22분ProCICD-093Terraform drift 수정이 canary 타깃 그룹 route를 아직 담고 있는 subnet을 교체plan은 교정처럼 보이는데 적용하면 라이브 트래픽이 끊깁니다 — 낡았다던 서브넷 하나가 아직 활성 canary 경로를 붙잡고 있습니다.CI/CD고급22분ProCICD-073Terraform plan은 안전해 보이는데 for_each 키 이름 변경 후 apply가 IAM role을 다시 만듦검토에서는 뚜렷한 파괴적 변경이 보이지 않는데 apply가 활성 role을 교체합니다 — 리팩터 중 for_each가 쓰는 안정 키가 바뀌었습니다.CI/CD고급22분ProSECURITY-1191WAF가 뻔한 route는 허용하면서도 공격을 놓침공개 가이드를 따라 WAF를 배포해 정상으로 보였는데, 보호된 edge 경로를 우회하는 대체 hostname으로 같은 앱에 여전히 접근됩니다.Security고급22분ProK8S-076복제 복구 테스트 후 VolumeSnapshot 복원이 엉뚱한 PVC 계보에 바인딩됨스냅샷 데이터는 유효한데 이후 복원이 엉뚱한 기대 체인에 붙습니다 — 테스트 중에 스냅샷 내용과 클론 이름을 너무 대충 재사용했습니다.Kubernetes고급22분ProSECURITY-053CSP nonce는 제대로 생성되는데 CDN 템플릿 캐싱 후 사라짐애플리케이션은 새 nonce를 렌더링하는데 브라우저가 계속 스크립트를 막습니다 — 캐시된 edge 조각이 오래된 헤더-본문 조합을 재사용합니다.Security고급23분ProSECURITY-063KMS 정책이 백업 작업의 암호화는 허용하는데 복구 계정의 복원 작업이 복호화하지 못함백업은 잘 끝나는데 모든 복원 시도가 실패합니다 — 재해 복구 계정에 같은 키에 대한 전체 복호화 경로가 부여된 적이 없습니다.Security고급23분ProSECURITY-1183관리 규칙 하나가 요청 패턴에 과적합해 AWS WAF가 안전한 관리자 경로를 차단관리 규칙 집합이 edge는 잘 보호하는데, 본문이 일반 공격 시그니처를 닮은 정상 관리자 워크플로를 차단하기 시작합니다.Security고급23분ProCICD-063교차 계정 백엔드에서 죽은 apply 뒤에도 Terraform 원격 state 잠금이 살아남음실패한 apply에 더는 활성 프로세스가 없는데도 이후 모든 실행이 잠금에서 멈춥니다 — 백엔드 정리 경로가 계정 간에 끝까지 완료되지 않았습니다.CI/CD고급23분ProK8S-062노드 상실 후 오래된 VolumeAttachment 객체가 PVC 재연결을 막음대체 노드는 준비됐는데 워크로드가 볼륨을 마운트하지 못합니다 — 스토리지 컨트롤 경로가 아직 옛 attach가 살아 있다고 믿습니다.Kubernetes고급23분ProCICD-083스키마 마이그레이션이 writer에서는 성공하는데 read replica가 canary 트래픽에 계속 호환되지 않는 형태를 서빙마이그레이션 로그는 성공으로 보이는데 canary가 계속 실패합니다 — 복제 지연 때문에 일부 트래픽이 옛 스키마 경로를 읽습니다.CI/CD고급23분ProSECURITY-1195클라우드 role assume이 한 리전에서는 되고 다른 곳에서 실패공개 가이드를 따른 클라우드 인증 배포가 한 리전에서는 됐습니다. 두 번째 리전은 신뢰 조건이 아직 직전 audience나 issuer 패턴을 기대해 실패합니다.Security고급23분ProSECURITY-1198클라우드 감사 추적이 한 계정에서는 완전한데 다른 계정에서 aggregator role이 권한을 잃어 공백이 생김중앙 보안 가시성은 전반적으로 정상인데 연결된 계정 하나가 조용히 데이터 제공을 멈춥니다 — aggregator role이 거기 접근 권한을 잃었습니다.Security고급23분ProK8S-071AZ 장애 후 PodDisruptionBudget과 topology spread가 합법적인 복구 배치를 남기지 않음장애 전에는 워크로드에 replica가 충분했는데 zone 하나가 사라진 뒤 남은 규칙들 때문에 모든 복구 선택지가 분산이나 disruption 보장 중 하나를 어깁니다.Kubernetes고급24분ProCICD-075blue-green 노드 그룹 전환이 대체 경로가 준비되기 전에 유일한 로그 shipper를 drain새 노드는 앱 입장에서는 정상인데 운영 가시성이 사라집니다 — 대체 fleet이 완전히 붙기 전에 drain 순서가 클러스터 전역 DaemonSet을 걷어냈습니다.CI/CD고급24분ProCICD-090canary bake 시간이 큐 가시성 창보다 짧아 실패 신호가 승격 후에 도착롤아웃은 bake 단계를 통과하는데 숨은 worker 실패가 큐 타임아웃 구간이 지난 뒤, 트래픽이 완전히 넘어가고 한참 뒤에야 드러납니다.CI/CD고급24분ProCICD-066Lambda가 사설 의존성으로의 egress를 잃어 CodeDeploy 검증 훅이 타임아웃배포 자체는 정상인데 수명주기 검증이 계속 실패합니다 — hook Lambda가 준비 상태를 증명하는 데 쓰는 내부 API에 닿지 못합니다.CI/CD고급24분ProK8S-069노드 풀 간 CNI MTU가 달라 노드 간 gRPC 호출이 실패노드 내부 트래픽은 깨끗한데 더 큰 노드 간 요청이 멈춥니다 — 노드 풀 하나가 다른 경로가 기대하는 것보다 작은 실효 MTU를 씁니다.Kubernetes고급24분ProSECURITY-038인증 헤더가 캐시 정책에 빠져 CDN이 인증된 오류 페이지를 캐시로그인 경로 자체는 맞는데 개인화된 실패 응답 하나가 edge에 캐싱돼 이후 사용자에게 엉뚱한 내용이 새어 나갑니다.Security고급24분ProSECURITY-069조직 전역 CloudTrail은 켜져 있는데 리전 하나가 기대한 KMS 키를 끝내 쓰지 않음감사 로깅은 어디에나 있는데 리전 하나가 암호화 기준을 위반합니다 — 복제와 키 정책 전제가 시간이 지나며 갈렸습니다.Security고급24분Pro