섹션별 상세
GPU 할당 및 헬스 체크 지연을 제거하기 위해 유휴 상태의 건강한 GPU를 미리 확보해두는 클라우드 버퍼 시스템을 운영합니다. 이를 통해 새로운 복제본이 필요할 때 즉시 스케줄링이 가능하며, 인스턴스 생성에 소요되는 수 분에서 수십 분의 시간을 핫 패스에서 제외할 수 있습니다.


근거
- Modal의 최적화를 통해 AI 추론 서버 복제본 스케일링 시간을 2,000초에서 수십 초로 단축했다. — Introduction 섹션 및 Figure 1 (Image 3) 출처
컨테이너 시작 시 수 기가바이트의 데이터를 모두 로드하는 대신 메타데이터만 먼저 읽고 실제 데이터는 필요할 때 불러오는 ImageFS 커스텀 파일시스템을 사용합니다. libfuse 기반의 이 시스템은 다중 계층 캐시를 활용하여 컨테이너 시작 시간을 약 1분가량 단축하며, 전체 파일의 극히 일부만 사용하는 추론 작업의 특성을 이용합니다.

import torch와 같은 무거운 라이브러리 로딩 과정을 건너뛰기 위해 gVisor의 runsc를 활용한 CPU 메모리 스냅샷 기술을 적용했습니다. 실행 중인 프로세스의 힙과 스레드 상태를 스냅샷으로 저장하고 이를 메모리에 직접 복구함으로써 호스트 측 초기화 시간을 약 10배 단축합니다.
가장 많은 시간이 소요되는 GPU 측 초기화(CUDA 그래프 캡처, 컴파일 등)를 해결하기 위해 NVIDIA 드라이버의 기능을 활용한 GPU 메모리 스냅샷을 구현했습니다. 장치 메모리 상태를 호스트 메모리를 거쳐 디스크에 저장하고 복구함으로써 vLLM 기준 평균 부팅 지연을 95초에서 13초 수준으로 줄이는 성과를 거두었습니다.
근거
- vLLM 부팅 평균 지연 시간이 스냅샷 미적용 시 95,679ms에서 적용 시 13,797ms로 개선되었다. — GPU memory snapshotting 섹션 하단 테이블
- Reducto는 GPU 메모리 스냅샷을 통해 콜드 스타트를 약 6배(70초에서 12초) 단축했다. — Spotlight Use Case: Reducto 섹션
기술
- vLLM
- SGLang
- CUDA
- libfuse
- gVisor
- CRIU
- PyTorch
활용 사례
- 가변 트래픽 대응형 LLM 추론 서비스
- 대규모 문서 처리 파이프라인 (Reducto 사례)
- 오디오/음성 생성 AI 서비스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 12.수집 2026. 05. 12.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.