벤더문제 339개· 검수 문제 9개

AWS

AWS 환경에서 일어나는 장애 문제 339개를 모았습니다.

모든 문제 339개

K8S-1277노드 그룹이 클러스터에 합류하는데 DaemonSet pod가 계속 깨진 상태커스텀 AMI나 launch template으로 새 노드를 올렸는데 그 인스턴스에서만 플랫폼 애드온이 이상하게 동작합니다.Kubernetes고급18분ProK8S-1289노드 재생성 전까지 클러스터가 정상으로 보임몇 달 잘 돌던 클러스터에서 갑자기 새 노드가 워크로드를 만들지 못합니다 — admission webhook이 새 노드에서만 도달 불가입니다.Kubernetes고급18분ProK8S-1295롤아웃이 zone 하나에서만 멈춤클러스터 drain이 깨끗이 시작되는데, 전체 용량은 충분한데도 워크로드 하나가 끝내 재스케줄되지 않습니다.Kubernetes고급18분ProCICD-127릴리스 파이프라인이 원래 이미지 digest로 SBOM을 서명하는데 막판 재빌드가 새 digest를 만들어 서명 없이 나감모든 규정 준수 리포트가 유효한 attestation을 가리키는데, 정작 실제로 나가는 이미지의 것은 아닙니다.CI/CD고급18분ProCICD-234릴리스 후보가 한 리전에서 smoke test를 통과하는 사이 트래픽 예열은 다른 리전을 상대로 일어남 (failover 리허설 중)검증은 빌드가 안전하다고 하는데 실제 트래픽을 받는 워크로드는 테스트가 돌린 그 워크로드가 아닙니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD중급18분ProK8S-1281배포가 성공할 때마다 pod가 재시작사설 엔드포인트나 의존성 주소가 바뀐 직후, 롤아웃이 일부 노드에서는 되고 다른 노드에서 실패합니다.Kubernetes고급18분ProLINUX-1212서비스가 다시 만들기 전에 tmpfiles 정리가 돌아 재부팅 후 소켓 디렉터리가 사라짐몇 주 잘 돌던 서비스가 이제 부팅에서 실패합니다 — 런타임 디렉터리 수명주기를 tmpfiles가 소유하고 시작 순서가 바뀌었습니다.Linux고급18분ProCICD-1228자체 호스팅 runner가 아티팩트 저장소에는 닿는데 업로드가 계속 실패자체 호스팅 runner가 코드와 의존성은 내려받는데 아티팩트 업로드 호출에서만 실패하기 시작합니다.CI/CD고급18분ProK8S-1287재부팅 후 StatefulSet은 복구되는데 멤버 하나가 계속 엉뚱한 볼륨을 붙임stateful 워크로드를 이전하거나 복원한 뒤 ordinal 하나가 반복해서 엉뚱한 영구 데이터로 부팅합니다.Kubernetes고급18분ProCICD-477재사용 워크플로가 컨테이너 이미지를 제대로 서명하는데 하위 승격이 별도 저장소의 서명 안 된 digest를 다시 태깅 (구 경로 종료 훈련 중)공급망 통제가 주 경로는 보호하는데 부수 승격 lane이 서명된 아티팩트를 우회합니다. 주 구성 요소는 계속 트래픽을 서빙하는데, 폐기 훈련이 제거 대상에 대한 잠복 의존성을 드러냅니다.CI/CD중급18분ProCICD-112캐시 예열이 오래된 base 이미지를 내부 mirror에 게시해 이후 모든 빌드가 취약한 레이어를 물려받음의존성 warmup 단계는 성공하는데 이후 빌드가 신선도 정책을 우회한 미러 base 이미지 때문에 오염됩니다.CI/CD고급18분ProCICD-330컨테이너 빌드는 이미지 생성 시 한 CA 번들을 쓰는데 런타임 base 레이어가 갱신되며 다른 내부 PKI root를 신뢰 (failover 리허설 중)빌드된 이미지와 이후 실행되는 이미지 계보가 더는 같은 trust store 전제를 공유하지 않습니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD고급18분ProCICD-240투명 재압축으로 실제 페이로드 신원이 바뀐 뒤에도 무결성 게이트가 객체 저장소 ETag를 신뢰 (failover 리허설 중)객체는 있는데 해시 같은 신호가 더 이상 원래 바이너리 내용을 대표하지 않습니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD고급18분ProCICD-1251hotfix 워크플로는 올바른 이미지를 빌드하는데 운영 배포가 계속 직전 digest를 재사용hotfix 릴리스가 승인돼 빠르게 배포됐는데, 배포 후 확인에서 클러스터가 여전히 직전 이미지 빌드를 돌리고 있음이 드러납니다.CI/CD고급19분ProK8S-1246Service에 endpoint가 있고 pod도 Ready인데 요청이 계속 실패새로 도입한 노드 부류의 pod는 정상인데, 옛 노드에서는 되는 같은 Service가 그 pod에 닿는 클라이언트에서만 타임아웃합니다.Kubernetes고급19분ProK8S-1251Service의 pod와 endpoint가 정상인데 요청이 계속 실패EKS 클러스터에 새 노드 그룹이 합류했는데, 완전히 Ready인데도 거기 배치된 pod만 Service 트래픽에서 실패하기 시작합니다.Kubernetes고급19분ProK8S-1248StatefulSet 볼륨은 성공적으로 다시 붙는데 기동이 계속 실패노드 이벤트 후 stateful 워크로드가 다른 노드에서 돌아오는데, 붙은 데이터 볼륨에 대해 즉시 권한 오류로 실패합니다.Kubernetes고급19분ProCICD-186검토된 Terraform plan이 다른 provider 컨텍스트에서 적용됨 (failover 리허설 중)diff는 안전해 보이는데 apply 시점의 런타임 별칭이나 계정 컨텍스트가 다른 인프라를 가리킵니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD고급19분ProK8S-1229그 AMI 변형에 자격 증명 provider 바이너리가 없어 노드 그룹 하나에서만 이미지 pull이 실패같은 service account와 image pull secret이 다른 곳에서는 되는데 node group 하나가 계속 실패합니다 — 그쪽 이미지 자격 증명 helper 구성이 다릅니다.Kubernetes고급19분ProCICD-288단계적 롤백이 옛 manifest는 복원하는데 뒷단 secret 참조가 이미 새 키 계열로 교체됨 (failover 리허설 중)옛 릴리스는 다시 뜨는데 그 런타임 secret 계약이 더 이상 같은 형태로 존재하지 않습니다. failover 리허설에서 standby나 대체 경로가 활성화되기 전까지는 평상시 트래픽이 문제를 감췄습니다.CI/CD고급19분Pro