Linux Service Operations
Linux Service Operations 관련 장애 문제 65개를 모았습니다. 검수된 문제부터 풀어 보세요.
먼저 읽을 가이드
추천 문제
모든 문제 65개
LINUX-093감시 대상 파일이 계속 touch돼 systemd path unit이 실패한 헬퍼를 계속 다시 띄움서비스가 스스로 재시작하는 것처럼 보이는데 진짜 원인은 같은 파일 활동 루프에 계속 반응하는 path unit입니다.Linux고급17분ProLINUX-090systemd cgroup 메모리 한도가 헬퍼 프로세스를 죽이는데 주 서비스 로그는 무관해 보임애플리케이션이 무관한 코드 경로에서 실패하는 것처럼 보이는데, 숨은 원인은 unit의 cgroup 예산 안에서 헬퍼 프로세스가 OOM으로 죽는 것입니다.Linux고급18분ProLINUX-078원자적 교체 스크립트가 끝내 완료되지 않아 nftables set 갱신에 오래된 IP 항목이 남음방화벽 갱신은 도는 것처럼 보이는데 낡은 멤버 일부가 계속 활성입니다 — 원자적 갱신 경로가 중간에 실패해 옛 set이 깔끔히 교체되지 않았습니다.Linux고급19분ProLINUX-087패키지 롤백이 바이너리는 되돌리는데 이전된 systemd unit 의존성 그래프는 되돌리지 않음옛 패키지 버전으로 되돌렸는데 서비스가 계속 잘못 동작합니다 — 의존 unit이 이후 릴리스에서 바뀌었고 패키지와 함께 되돌려지지 않았습니다.Linux고급20분ProLINUX-067chrony source 우선순위 drift가 사이트 하나를 Kerberos 허용 시간 오차 밖으로 밀어냄기술적으로는 어디서나 NTP가 도는데 한 위치가 품질이 낮은 source를 따라, 시간에 민감한 인증을 깨뜨릴 만큼만 어긋납니다.Linux고급21분ProLINUX-054firewalld reload가 옛 규칙 집합을 복원해 nftables hotfix가 사라짐수동 패킷 필터 변경이 당장의 장애는 해결하는데, 다음 reload나 재부팅이 옛 정책을 되살립니다 — 영구 원본을 갱신한 적이 없습니다.Linux고급23분ProLINUX-007시스템 시간 드리프트로 TLS 검증이 간헐 실패하는 문제애플리케이션은 멀쩡한데 인증서 유효시간 검증이 어긋나는 시스템 시간 문제를 다룹니다.Linux고급23분ProLINUX-035PAM limit을 올렸는데 systemd 서비스가 계속 too many open files에 걸림대화형 셸은 새 한도를 제대로 물려받는데 데몬은 부하에서 계속 실패합니다 — 서비스 수준 한도가 그대로입니다.Linux고급25분ProLINUX-026메모리 급증이 사라진 뒤에도 swap 활동이 계속 높음장애는 끝났는데 swap 요동이 계속 높아 하루 종일 지연을 예측할 수 없게 만듭니다.Linux고급25분ProLINUX-023임시 디스크 압박이 캐시는 죽이고 근본 원인은 건드리지 못함임시 파일 정리로 시간은 벌지만 다른 프로세스의 쓰기 증폭이 곧 같은 디스크 압박을 다시 만듭니다.Linux고급26분ProLINUX-1489PAM faillock 초기화는 성공했는데 원격 사용자가 계속 실패faillock을 초기화한 뒤에도 홈 마운트 신원 캐시가 있는 노드에서만 사용자가 계속 잠깁니다.Linux고급10분ProLINUX-1482Fedora rsyslog 큐는 비워지는데 journald가 계속 커짐Fedora 기반 로그 collector에서 rsyslog spool을 강화한 뒤 journald의 디스크 사용량이 계속 늘어납니다.Linux고급11분ProLINUX-1486sudoers 정책은 맞아 보이는데 host 하나가 계속 관리자를 거부cloud-init 스니펫으로 부트스트랩된 host에서 패키지 업그레이드 후에만 관리자 sudo가 실패합니다.Linux고급11분ProLINUX-1484NFS 마운트는 깨끗이 다시 마운트되는데 앱 하나가 계속 stale handle을 봄다시 마운트한 NFS 경로가, 점검 창을 넘긴 프로세스에서만 계속 stale file handle 오류를 냅니다.Linux고급12분ProLINUX-1487재부팅 후 mdadm reshape가 재개되고 쓰기 성능이 무너짐배열은 정상이라고 보고하는데 reshape 도중 재부팅한 뒤 처리량이 급락합니다.Linux고급12분ProLINUX-092커널 파라미터를 sysctl.d에서 조정했는데 사전순 때문에 앞선 파일이 이김원하는 설정이 디스크에는 있는데 호스트가 다른 값을 씁니다 — sysctl 로드 순서상 앞이나 뒤의 파일이 덮어씁니다.Linux고급15분ProLINUX-028컨테이너 host의 CPU는 낮은데 cgroup 하나가 심하게 throttle전체 노드 사용률은 안전해 보이는데 서비스 하나가 심하게 throttle됩니다 — 그 cgroup 한도가 너무 낮습니다.Linux중급20분ProLINUX-022systemd 서비스가 너무 빠르게 재시작해 쓸모 있는 로그를 잡지 못함재시작 루프 때문에 서비스를 살펴보기 어렵습니다 — 운영자가 제대로 된 신호를 잡기 전에 프로세스가 죽습니다.Linux중급21분ProLINUX-025소켓 backlog 튜닝이 애플리케이션 accept 병목을 가림커널 큐 설정은 늘렸는데 서비스가 계속 멈춥니다 — 애플리케이션이 연결을 충분히 빠르게 비우지 못합니다.Linux중급22분ProLINUX-003Nginx 502 장애에서 업스트림 애플리케이션 병목 추적하기프록시, 포트, 애플리케이션 상태, 타임아웃 설정을 종합적으로 보는 장애 해결 연습입니다.Linux고급28분Pro