lmcachе
LMCache
LLM 추론 중 생성된 KV 블록을 GPU 외부 저장 계층으로 이동하고 필요할 때 다시 읽어오는 캐시 구성 요소입니다. 이 글에서는 GPU의 L0 다음에 호스트 DRAM 기반 L1을 두고, fs:// connector를 통해 Curvine의 공유 NVMe L2와 연결합니다. Pod 내부의 CPU 오프로딩과 복제본 간 캐시 공유를 함께 처리해 긴 프롬프트의 Prefill 비용을 낮춥니다.
LMCache
LLM 추론 중 생성된 KV 블록을 GPU 외부 저장 계층으로 이동하고 필요할 때 다시 읽어오는 캐시 구성 요소입니다. 이 글에서는 GPU의 L0 다음에 호스트 DRAM 기반 L1을 두고, fs:// connector를 통해 Curvine의 공유 NVMe L2와 연결합니다. Pod 내부의 CPU 오프로딩과 복제본 간 캐시 공유를 함께 처리해 긴 프롬프트의 Prefill 비용을 낮춥니다.