본문으로 건너뛰기

llm-d FS 백엔드: vLLM을 위한 공유 스토리지 기반 KV 캐시 오프로딩

vLLM의 KV 캐시를 공유 파일 시스템으로 오프로딩하여 노드 간 캐시 공유와 무한한 확장성을 구현하고 분산 추론 처리량을 최적화하는 기술이다.

섹션별 상세

01
KV 캐시 재사용의 중요성과 기존 하드웨어 메모리의 물리적 한계를 지적한다. Transformer 기반 모델의 Prefill 단계는 연산 집약적이지만, 생성된 KV 텐서를 캐싱하면 이후 동일한 접두사(Prefix) 사용 시 연산을 생략할 수 있다. 그러나 GPU HBM은 수십 GB 수준으로 제한적이며, Llama-3.1-70B 모델의 경우 100만 토큰당 약 305GB의 캐시가 필요하여 메모리 부족 현상이 빈번하게 발생한다.
02
llm-d FS 백엔드는 vLLM의 Offloading Connector에 플러그인 형태로 작동하는 스토리지 솔루션이다. 공유 파일 시스템을 활용하여 KV 블록을 파일 형태로 저장하며, POSIX 표준을 준수하여 다양한 엔터프라이즈 스토리지와 호환된다. 이를 통해 여러 vLLM 인스턴스가 동일한 경로의 캐시를 공유하고, 노드 재시작이나 장애 시에도 캐시 데이터를 유지할 수 있는 영속성을 확보했다.
03
성능 최적화를 위해 완전 비동기 I/O와 병렬 처리 설계를 도입했다. vLLM의 메인 추론 경로를 방해하지 않도록 비동기적으로 데이터를 읽고 쓰며, 다중 워커 스레드를 통해 I/O 대역폭을 극대화했다. 또한 GPU DMA를 사용하여 데이터 전송 시 GPU 연산 커널과의 간섭을 최소화함으로써 높은 처리량을 유지한다.
04
벤치마크 결과, 단일 요청의 TTFT(Time to First Token)가 대폭 개선되었다. Llama-3.1-70B 모델 테스트에서 토큰 수가 증가함에 따라 Prefill(캐시 미스) 대비 최대 16.8배 빠른 속도를 기록했다. 비록 스토리지 속도가 DRAM보다는 느리지만, 대규모 컨텍스트 재사용 시 연산 비용을 압도적으로 절감하는 효과를 입증했다.
토큰 수 증가에 따른 다양한 오프로딩 매체별 성능 향상 배율 차트이다.
Chart토큰 수가 128k에 도달할 때 스토리지 오프로딩은 Prefill 대비 약 16.8배의 성능 이득을 보여준다. GPU와 CPU 오프로딩이 단일 요청에서는 더 빠르지만, 토큰 양이 많아질수록 스토리지 역시 유의미한 가속 효과를 제공함을 입증한다.
05
확장성 테스트에서 공유 스토리지는 성능 급락(Performance Collapse)을 방지하는 핵심 역할을 수행했다. GPU나 CPU 메모리 용량을 초과하는 다수 사용자의 요청이 들어올 때, 기존 방식은 처리량이 급격히 떨어지지만 FS 백엔드는 스토리지의 방대한 용량을 활용해 안정적인 성능 곡선을 유지했다. 이는 특히 RAG 시스템이나 에이전트 루프처럼 공통 접두사 사용이 많은 실제 워크로드에서 큰 이점을 제공한다.
사용자 수 증가에 따른 GPU, CPU, 스토리지 오프로딩의 전체 토큰 처리량 변화를 비교한 그래프이다.
ChartGPU와 CPU 캐시 용량을 초과하는 시점에서 처리량이 0에 가깝게 급락하는 반면, 스토리지 오프로딩은 일정한 수준의 처리량을 유지한다. 이는 스토리지가 메모리 한계를 극복하여 시스템의 성능 붕괴를 막는 안전장치 역할을 함을 보여준다.
실제 혼합 워크로드 환경에서 사용자 그룹 수에 따른 전체 토큰 처리량 추이를 보여준다.
Chart사용자 그룹이 늘어날수록 모든 방식의 처리량이 감소하지만, 스토리지 오프로딩 방식이 가장 높은 처리량을 유지한다. 비동기 스토리지 사용이 GPU 자원을 Prefill과 Decode 연산에 집중할 수 있게 하여 전체 효율을 높인 결과이다.

용어 해설

KV 캐시(KV Cache)
Transformer 모델 추론 시 이전 토큰들의 Key와 Value 행렬을 저장하여 매번 새로 계산하지 않도록 하는 기술이다. 추론 속도를 높이지만 모델 크기와 컨텍스트 길이에 따라 막대한 메모리를 점유하는 병목 현상을 일으킨다.
첫 토큰 생성 시간(TTFT)
사용자가 프롬프트를 입력한 후 모델로부터 첫 번째 토큰이 출력될 때까지 걸리는 지연 시간이다. 대규모 프롬프트를 처리하는 Prefill 단계의 연산 효율성에 직접적인 영향을 받는다.
프리필(Prefill)
LLM 추론의 첫 단계로, 입력된 전체 프롬프트를 한 번에 처리하여 초기 KV 캐시를 생성하는 과정이다. 연산 집약적인 단계이며, 캐시 재사용을 통해 이 과정을 생략하는 것이 성능 최적화의 핵심이다.
오프로딩(Offloading)
GPU의 한정된 고대역폭 메모리(HBM) 용량을 초과하는 데이터를 상대적으로 저렴하고 용량이 큰 CPU RAM이나 스토리지로 옮겨 저장하는 기법이다. 메모리 부족으로 인한 시스템 중단을 방지하고 더 긴 컨텍스트를 처리하게 해준다.
포식스(POSIX)
서로 다른 운영체제 간의 호환성을 위해 규정된 인터페이스 표준이다. 본 아티클에서는 특정 벤더의 스토리지에 종속되지 않고 표준 파일 시스템 인터페이스를 통해 어디서나 작동함을 의미한다.

기술

  • vLLM
  • llm-d
  • IBM Storage Scale
  • Python
  • GPU DMA

활용 사례

  • 대규모 RAG 시스템
  • 멀티턴 대화 챗봇
  • 자율 AI 에이전트 루프
  • 공유 시스템 프롬프트 환경

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 25.수집 2026. 02. 25.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.