본문으로 건너뛰기

KV 캐시 로컬리티: 로드 밸런서가 GPU 연산을 낭비하는 이유와 해결책

LLM 서빙 시 로드 밸런서가 토큰 접두사(Prefix)를 인식하여 동일한 KV 캐시를 보유한 GPU로 요청을 라우팅함으로써 추론 효율을 극대화하는 방법론을 제시한다.

섹션별 상세

기존 로드 밸런싱 알고리즘은 연결 수만 계산할 뿐 토큰의 로컬리티를 이해하지 못해 GPU 자원을 낭비한다. 라운드 로빈 방식은 동일한 시스템 프롬프트를 가진 요청을 서로 다른 GPU로 분산시켜, 이미 다른 카드에 존재하는 KV 캐시를 활용하지 못하고 중복 Prefill 연산을 수행하게 만든다. 이로 인해 8개의 GPU를 사용할 경우 동일한 작업을 8번 결제하는 것과 같은 비용 비효율이 발생한다.
트랜스포머 추론은 Prefill과 Decode 두 단계로 나뉘며, Prefill 단계의 KV 캐시 적중 여부가 성능을 결정한다. Prefill은 입력 토큰의 키-값 쌍을 계산하는 고비용 연산인 반면, Decode는 이를 재사용하는 저비용 단계이다. CodeLlama 13B 기준 캐시 적중 시 TTFT는 18ms이지만, 미적중 시 500ms로 약 28배의 성능 차이가 발생하며 이는 전적으로 데이터가 해당 GPU 메모리에 있는지에 달려 있다.
Prefix-aware 라우팅을 적용하면 동일 하드웨어에서 처리량과 지연 시간을 동시에 대폭 개선할 수 있다. 8개의 A100 GPU 환경에서 실험한 결과, 라운드 로빈의 캐시 적중률은 12.5%에 불과했으나 Prefix-aware 방식은 97.5%를 기록했다. 이를 통해 처리량은 22.3% 향상되었으며, 월간 GPU 비용 기준 노드당 약 $1,200~$1,800의 낭비를 방지할 수 있음이 확인됐다.
근거
  • 8개 GPU 노드에서 라운드 로빈 사용 시 월간 약 $1,200~$1,800의 GPU 비용이 낭비된다. The Math on Wasted Prefill 섹션의 비용 계산
모델의 크기와 프롬프트의 길이가 길어질수록 KV 캐시 로컬리티의 경제적 가치는 더욱 커진다. Llama 3.1 70B와 같은 대형 모델은 Prefill 연산이 매우 무겁기 때문에 캐시 적중 시 응답 속도가 44% 빨라지는 효과를 본다. 또한 공유 컨텍스트가 16K 토큰에 달하는 경우 캐시 미적중 시마다 약 400ms의 GPU 연산 시간이 추가로 낭비되므로 긴 컨텍스트를 사용하는 RAG 앱에서 최적화 효과가 극대화된다.
사용자 경험의 핵심인 테일 레이턴시(P99) 개선에서 Prefix-aware 라우팅이 압도적인 성능을 보여준다. 30명의 동시 사용자가 있는 부하 상황에서 라운드 로빈의 P99 TTFT는 6.8초에 달해 서비스가 불가능한 수준이었으나, 최적화 라우팅 적용 시 1초로 단축됐다. 이는 대부분의 요청이 Prefill을 건너뛰면서 큐가 빠르게 비워지고, 간헐적인 캐시 미적중 요청도 더 빠르게 처리될 수 있기 때문이다.
근거
  • Prefix-aware 라우팅은 P99 TTFT를 6,800ms에서 1,000ms로 85.3% 개선했다. The P99 Story 섹션 및 8x A100 벤치마크 수치

기술

  • vLLM
  • Llama 3.1
  • CodeLlama
  • Ranvier
  • A100 GPU

활용 사례

  • RAG 시스템
  • 긴 대화 히스토리를 가진 챗봇
  • 코드 완성 서비스

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 01.수집 2026. 05. 01.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.