알림 파이프라인 정리로 relabel 규칙을 합친 뒤, 경보는 계속 발동하는데 일부 사건이 담당 팀을 호출하지 않습니다.
Prometheus 알림이 Alertmanager에 도달하는데 담당 팀에 호출이 안 감 — 알림 relabel 단계가 라우팅 규칙 실행 전에 `owner` label을 제거
Security 원문 시나리오에서 주요 증상 신호를 기준으로 근본 원인과 안전한 복구 방향을 정리하는 문제입니다.
시나리오
먼저 볼 것
- 보안 정책, 인증 흐름, 접근 제어 원인을 운영 관점에서 분리하기
- 기능 장애처럼 보이는 보안 문제를 로그와 정책 기준으로 해석하기
- 차단과 복구, 재발 방지 사이의 균형점을 정리하기
점검 체크리스트
- 무엇이 차단되었는지보다 어떤 정책이 적용되었는지 먼저 확인합니다.
- 인증, 권한, 네트워크 정책, 보안 장비 로그를 같은 시간축으로 정리합니다.
- 임시 허용 조치와 장기 정책 수정안을 분리해서 기록합니다.
복구와 재발 방지
Alertmanager 라우트를 다시 쓰기 전에 relabel 전후의 label을 비교하세요.
같이 보면 좋은 질문
네. 제목과 시나리오는 실제 장애 단서이므로 그대로 유지합니다. 한국어 풀이는 판단 순서와 답안 구조를 돕기 위한 보조 설명입니다.
아니요. IAM, token, certificate 같은 기술 용어와 audit 같은 명령어는 영어 원문을 유지하세요.
사용자 영향, 관찰한 근거, 최근 변경, 안전한 복구 방향을 한 번에 연결해 설명하는 것입니다.
현장에서 본 비슷한 케이스