TL;DR
대규모 LLM 추론에서는 GPU 메모리와 Pod별 고립된 KV cache 때문에 동일한 prefix를 반복 Prefill하는 비용이 커집니다. 이 구조는 vLLM GPU L0, LMCache CPU L1, Curvine 공유 NVMe L2를 연결하고 HyperPod Intelligent Routing으로 캐시 적중 가능성이 높은 replica를 선택합니다. 두 Pod 검증에서 1,925개 token의 100% cross-Pod hit을 기록했으며, 2,500-token prompt에서는 cold 774 ms가 warm 287 ms로 줄어 2.7× TTFT 개선을 얻었습니다. 다만 1,000 token 미만 prompt에서는 L2 네트워크 비용이 재계산과 비슷하므로 L0와 L1 중심 구성이 더 적합합니다.
섹션별 상세

- Curvine Worker는 node-local NVMe에 데이터를 저장하고 Primary Node는 metadata와 journaling을 Amazon EBS에 지속합니다. — Solution design의 L2 계층 설명과 Figure 1·Figure 2의 Master/Worker 및 저장 계층 구조에 근거가 있습니다.

aws sagemaker update-cluster \
--cluster-name hyperpod-cluster-eks \
--tiered-storage-config Mode=Enable,InstanceMemoryAllocationPercentage=20 \
--node-recovery Automatic기존 SageMaker HyperPod cluster에서 Tiered Storage와 호스트 메모리 20% 할당을 활성화합니다.
용어 해설
- KV 캐시(KV Cache)
- — LLM이 이미 처리한 토큰의 attention key와 value를 저장해 다음 생성 단계에서 재계산을 피하는 메모리 구조입니다. vLLM은 이를 토큰 블록 단위로 관리하고, Prefix Caching은 동일한 앞부분을 공유하는 요청 사이에서 저장된 블록을 재사용합니다. 캐시가 GPU·CPU·NVMe로 확장되면 긴 프롬프트와 여러 복제본 사이의 중복 연산을 줄일 수 있습니다.
- Prefix Caching
- — 여러 요청이 동일한 선행 토큰을 공유할 때 해당 구간의 KV 블록을 재사용하는 추론 최적화 기법입니다. 시스템 프롬프트나 반복되는 RAG 컨텍스트를 캐시 키로 삼아 Prefill을 건너뛰며, vLLM의 GPU 캐시가 주된 실행 계층으로 작동합니다. 복제본별 캐시가 분리된 환경에서는 Intelligent Routing과 공유 L2 계층이 재사용 범위를 넓힙니다.
- LMCache
- — LLM 추론 중 생성된 KV 블록을 GPU 외부 저장 계층으로 이동하고 필요할 때 다시 읽어오는 캐시 구성 요소입니다. 이 글에서는 GPU의 L0 다음에 호스트 DRAM 기반 L1을 두고, fs:// connector를 통해 Curvine의 공유 NVMe L2와 연결합니다. Pod 내부의 CPU 오프로딩과 복제본 간 캐시 공유를 함께 처리해 긴 프롬프트의 Prefill 비용을 낮춥니다.
- FUSE
- — 사용자 공간 프로그램이 분산 저장소를 일반 디렉터리처럼 마운트하도록 만드는 파일시스템 인터페이스입니다. Curvine의 FUSE client는 여러 GPU 노드의 NVMe 풀을 하나의 namespace로 노출하고, 각 inference Pod가 ReadWriteMany PVC를 통해 같은 경로에 접근하게 합니다. 따라서 한 Pod가 기록한 KV cache file을 다른 Pod가 동일한 파일 경로에서 읽을 수 있습니다.
- Intelligent Routing
- — 요청의 prefix 또는 각 worker의 KV cache 상태를 조회해 캐시 적중 가능성이 높은 vLLM replica로 요청을 보내는 라우팅 기능입니다. prefix-aware 전략은 prefix tree를 사용하고 kv-aware 전략은 worker별 cache state를 활용하며, round-robin은 상태 비저장 배치에 적합합니다. 올바른 replica를 선택하면 수십 밀리초가 걸리는 L2 네트워크 읽기 대신 GPU L0 또는 CPU L1에서 캐시를 가져올 수 있습니다.
기술
- Amazon SageMaker HyperPod
- Amazon SageMaker HyperPod Inference Operator
- vLLM
- LMCache
- Curvine
- Amazon EKS
- FUSE
- Kubernetes CSI
- Amazon EBS
- Amazon S3
- HDFS
- NVMe
- Qwen2-7B-Instruct
활용 사례
- 공통 system prompt를 사용하는 multi-tenant LLM endpoint
- 반복 검색 context를 사용하는 RAG pipeline
- 대화 history가 누적되는 multi-turn dialogue
- 여러 vLLM replica 사이의 KV cache 공유
- Prefill/decode-disaggregated serving
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
