August 29, 2026
AWS Korea 18F (Centerfield EAST)
Asia/Seoul timezone

“모니터링은 정상인데 OOM?” Ubuntu 환경에서 eBPF로 추적하는 PyTorch 유령 메모리 누수

Aug 29, 2026, 2:30 PM
30m
1. 서원 | 국자감 (AWS Korea)

1. 서원 | 국자감

AWS Korea

강연(Talk / 20-30분) 인프라와 클라우드 (Infrastructure and Cloud)

Speaker

minjin park
MegazoneCloud, Microsoft Certified Trainer

Description

[세션 개요]
Ubuntu 기반 AI 인프라를 운영하다 보면 원인 모를 OOM(Exit 137) 장애를 마주하곤 합니다. Prometheus 대시보드나 컨테이너 메트릭은 완벽하게 정상이지만, PyTorch 프로세스가 갑자기 강제 종료되는 현상입니다. 이 문제는 PyTorch가 공유 메모리(/dev/shm)에 텐서를 생성한 후, 프로세스가 종료되는 과정에서 고아가 된 자식 워커들이 정리되지 않아 발생합니다. OS 수준에서는 (deleted) 상태로 마킹되어 지표에 잡히지 않지만, 실제로는 메모리가 반환되지 않고 노드 자원을 점유하는 ‘유령 메모리’ 현상입니다.

[핵심 내용 및 실전 트러블슈팅]
기존의 유저 스페이스 모니터링 도구로는 파악하기 힘든 이 사각지대를 Linux 커널 표준 기술인 eBPF로 추적하고 조치하는 방법을 공유합니다. 무거운 외부 솔루션 도입이나 애플리케이션 코드 수정은 필요하지 않습니다.
Ubuntu 커널에 내장된 BTF(CO-RE)와 공식 패키지인 bpftrace만으로 문제를 추적하는 과정을 실제 장애 재현 시나리오와 함께 단계별로 시연합니다. 특히 VFS(가상 파일 시스템) 내부의 kprobe:fput을 활용해 f_count 참조 카운트가 0으로 떨어지지 않는 누수 현상을 직접 포착하고, 커널 레벨에서 리소스가 해제되지 않고 잔존하는 원인을 정확히 찾아내는 실전 팁을 다룹니다.

[청중이 얻어갈 수 있는 것]
- 커널 레벨 진단 시야: 원인 불명의 OOM이 발생했을 때 단순 추측성 컨테이너 재시작에 의존하지 않고, 시스템 콜 수준에서 원인을 진단하는 접근법을 공유합니다.
- 모니터링의 사각지대 이해: 표준 메트릭 도구가 놓치는 가상 파일 시스템 레이어와 Linux 커널 실제 상태 간의 간극을 이해합니다.
- 바로 사용 가능한 오픈소스 스크립트: 발표자가 Pytorch의 유령 메모리를 관측할 때 사용한 bpftrace 기반 진단 스크립트를 GitHub 링크를 통해 공유받을 수 있습니다.

청중 사전 지식 Prior knowledge for audience

  • Linux 및 Ubuntu 터미널 환경에서 디버깅 명령어를 다뤄본 경험
  • PyTorch 기반 AI 워크로드 구동 또는 인프라 운영 과정에서 OOM 장애를 겪어본 경험
  • Kubernetes 컨테이너 격리와 리소스 제한(Limits)에 대한 기초적인 이해

발표자 소개 Biography

메가존클라우드의 Modernization Solutions Architect이자 Microsoft Certified Trainer(MCT)입니다. 오픈소스 Aya/Rust 기반 eBPF 에이전트인 'HoneyBeePF'의 코어 개발자이며, 해당 오픈소스는 eBPF 재단 의장 Bill Mulligan으로 부터 언급 받았습니다. Kubernetes 오케스트레이션과 Linux 커널 기술 사이의 공백을 연결하는 인프라 관측성이 주된 관심사입니다. .NET Conf, Korea MCT Summit 등 다수의 콘퍼런스에서 연사로 참여해 왔으며, 복잡한 Low-level 커널 개념을 현업 엔지니어들이 쉽게 이해하고 실무에 바로 적용할 수 있는 실전 플레이북 형태로 풀어내는 것을 좋아합니다.

난이도 Difficulty Advanced 고급
행동 강령 Code of Conduct 확인 Confirm

Presentation materials