AWS
AWS 환경에서 일어나는 장애 문제 339개를 모았습니다.
먼저 읽을 가이드
추천 문제
모든 문제 339개
CICD-1355원격 Terraform 실행이 모듈은 가져오고 provider 인증에 실패팀이 원격 실행으로 이전한 뒤, 모듈 조회와 백엔드 접근은 계속 되는데 provider 인증만 깨집니다.CI/CD중급13분ProCICD-1428CodeBuild 다단계 파이프라인이 빌드는 통과하고 배포에서 실패빌드는 성공하는데 아티팩트 버킷 라이프사이클 최적화를 도입한 뒤에만 배포가 실패하기 시작합니다.CI/CD고급14분ProCICD-1438CodeBuild 아티팩트 게시는 성공했는데 하류 배포가 실패빌드는 계속 잘 게시되는데도 아티팩트 버킷 최적화 후 배포가 실패하기 시작합니다.CI/CD고급14분ProCICD-1448CodeBuild 아티팩트는 S3에 도달했는데 배포가 실패빌드는 초록인데 아티팩트 버킷의 S3 라이프사이클 최적화 후 배포가 실패하기 시작합니다.CI/CD고급14분ProCICD-1347GitHub Actions OIDC 교환이 스케줄 실행에서만 실패조직이 배포 워크플로를 표준화한 뒤, push 기반 배포는 계속 되는데 예약 실행에서만 클라우드 인증이 실패함을 발견합니다.CI/CD중급14분ProCICD-1291생성된 워크플로가 저장소 하나에서만 실패저장소가 공유 배포 템플릿을 도입했는데, 복사된 버전에서 클라우드 인증이 실패한다는 걸 나중에야 발견합니다.CI/CD중급14분ProK8S-1284ALB ingress 규칙은 맞아 보이는데 경로 하나가 404동작하던 ingress를 새 API 버전으로 이전했는데, 규칙이 동등해 보이는데도 중첩 route 하나만 매칭을 멈춥니다.Kubernetes중급15분ProK8S-1298CronJob이 예기치 않게 겹침노드 변동이나 점검 창에서 예약 배치 작업이 중복된 부작용을 만들기 시작합니다.Kubernetes중급15분ProK8S-1282DaemonSet이 마지막 노드에 끝내 도달하지 못함에이전트 DaemonSet이 클러스터를 거의 다 덮는데 새로 도입한 노드 그룹 하나가 끝내 그것을 받지 않습니다.Kubernetes중급15분ProK8S-1276ingress는 프로비저닝되는데 health check가 계속 빨간색ALB 뒤의 서비스가 브라우저에서는 열리는데 health가 초록이 되지 않아 타깃이 계속 들락날락합니다.Kubernetes중급15분ProK8S-1290Job이 한 번은 성공하고 이후 불안정해짐배치 프로세스나 장시간 작업이 마운트된 secret을 한 번 읽고, 외부 교체 이벤트 이후 실패하기 시작합니다.Kubernetes중급15분ProK8S-1292NetworkPolicy 배포 후에만 validating webhook이 타임아웃하기 시작보안 강화 배포로 NetworkPolicy를 추가한 뒤 webhook 타임아웃 때문에 새 워크로드를 만들지 못합니다.Kubernetes중급15분ProK8S-1278pod가 서비스에 IP로는 닿고 이름으로는 못 닿음hostNetwork를 쓰는 모니터링이나 시스템 pod가, 순수 IP 연결은 되는데 서비스 디스커버리에서 실패하기 시작합니다.Kubernetes중급15분ProK8S-1286readiness probe가 수동으로는 통과하고 클러스터에서 실패서비스 메시나 sidecar 프록시를 쓰는 pod가 로컬 응답은 시작하는데 기동 후 몇 분간 readiness에 계속 실패합니다.Kubernetes중급15분ProK8S-1311StatefulSet 롤아웃이 대체 노드에서만 정체스토리지 애드온 갱신이 괜찮아 보이다가, stateful 워크로드가 새 노드에 배치되면 볼륨 attach가 끝내 성공하지 않습니다.Kubernetes중급15분ProK8S-1296노드는 Ready가 되는데 hostNetwork pod의 DNS가 실패노드 이미지 갱신이 안전해 보였는데 hostNetwork 워크로드만 이름 해석에 실패하기 시작합니다.Kubernetes중급15분ProCICD-1276릴리스 작업이 이미지는 제대로 만드는데 배포 host가 계속 직전 버전을 pull릴리스 파이프라인은 성공을 보고하는데, registry에 새 이미지가 있는데도 런타임이 계속 어제 이미지를 돌립니다.CI/CD중급15분ProK8S-1268ALB 타깃 그룹이 계속 unhealthy새로 노출한 서비스가 브라우저에서는 도달되는데 로드밸런서는 모든 타깃을 계속 비정상으로 표시합니다.Kubernetes중급16분ProK8S-1267Cluster autoscaler가 스케줄 불가 pod를 보면서도 확장하지 않음autoscaler 배포 자체는 정상으로 보이는데 pending 워크로드가 있는 클러스터가 끝내 확장되지 않습니다.Kubernetes중급16분ProK8S-1272CoreDNS는 도는데 pod가 외부 이름을 잘못 해석VPC 수준 네트워크 변경 후 CoreDNS는 Ready인 채로 EKS 클러스터가 이상한 외부 DNS 결과를 반환하기 시작합니다.Kubernetes중급16분Pro