본문으로 건너뛰기

Together AI, 캐시 인식 프리필-디코드 분리(CPD)로 긴 컨텍스트 추론 성능 혁신

Together AI는 캐시 히트율에 따라 워크로드를 분리하고 분산 KV 캐시를 활용하여 긴 컨텍스트 추론의 처리량을 40% 향상시킨 CPD 아키텍처를 공개했다.

섹션별 상세

01
기존의 프리필-디코드 분리(PD) 방식은 디코드 지연은 방지하지만, 대규모 신규 프롬프트(Cold)와 캐시 재사용이 가능한 프롬프트(Warm)가 동일한 프리필 자원을 공유하여 병목이 발생한다. CPD는 이를 해결하기 위해 요청의 캐시 히트율을 사전에 추정하여 워크로드를 물리적으로 격리한다.
02
CPD 아키텍처는 세 가지 역할의 노드로 구성된다. Pre-Prefill 노드는 캐시 재사용률이 낮은 Cold 요청을 처리하고 결과를 분산 캐시에 기록하며, Prefill 노드는 캐시 재사용률이 높은 Warm 요청을 우선 처리한다. Decode 노드는 프리필 간섭 없이 토큰 생성에만 집중한다.
CPD 시스템의 전체 아키텍처 다이어그램
Diagram캐시 인식 라우터가 요청을 Pre-Prefill, Prefill, Decode 노드로 배분하는 구조와 분산 KV 캐시 계층을 시각화했다. RDMA를 통한 고속 데이터 전송 경로와 스토리지 계층 간의 관계를 설명한다.
03
시스템의 핵심은 GPU 메모리, 호스트 DRAM, 클러스터 전체 분산 캐시로 이어지는 3단계 KV 캐시 계층 구조이다. RDMA를 통해 연결된 분산 캐시는 수 초가 걸릴 연산을 수백 밀리초의 데이터 전송으로 대체하며, 자주 사용되는 컨텍스트는 점진적으로 GPU와 가까운 계층으로 이동한다.
Cold 요청부터 Local Hit까지의 3단계 요청 처리 패턴 시퀀스 다이어그램
Diagram첫 번째 Cold 요청이 캐시를 생성하고, 이후 요청들이 분산 캐시(L3)와 로컬 캐시(L1/L2)를 단계적으로 재사용하며 지연 시간을 단축하는 과정을 보여준다.
04
캐시 인식 라우터는 각 요청의 프롬프트가 캐시에서 얼마나 제공될 수 있는지 추정하여 최적의 노드로 라우팅한다. 이를 통해 무거운 Cold 프롬프트가 공유 용량을 독점하는 것을 방지하고, Warm 요청을 위한 '빠른 경로'를 상시 유지하여 시스템의 확장성을 높인다.
05
NVIDIA B200 GPU 환경에서 실시한 벤치마크 결과, CPD는 기존 PD 방식 대비 지속 가능한 초당 쿼리 수(QPS)를 35-40% 향상시켰다. 특히 부하가 높은 상황에서도 중간값 TTFT를 1초 미만으로 유지하며 꼬리 지연 시간(p90)을 효과적으로 제어하는 성능을 보였다.
기존 Baseline 대비 CPD의 최대 달성 가능 QPS 비교 차트
ChartCPD 아키텍처가 기존 PD 방식보다 지속 가능한 QPS를 약 35-40% 향상시킴을 보여준다. 1D(디코드 노드 1개)와 2D 환경 모두에서 CPD가 일관되게 높은 처리량을 유지함을 확인할 수 있다.
Target QPS 증가에 따른 TTFT 및 처리량 변화 벤치마크 결과
Chart부하가 증가함에 따라 CPD가 Baseline보다 훨씬 완만한 TTFT 상승 곡선을 그리며, 특히 Prefill 처리량(Throughput) 면에서 우수한 효율을 유지함을 데이터로 증명한다.

용어 해설

프리필-디코드 분리(Prefill-Decode Disaggregation)
LLM 추론의 두 단계인 프리필(입력 처리)과 디코드(토큰 생성)를 물리적으로 다른 노드에서 수행하는 아키텍처이다. 연산 집약적인 프리필이 지연 시간에 민감한 디코드 과정을 방해하지 않도록 하여 전체 시스템의 효율성을 높인다.
키-값 캐시(KV Cache)
트랜스포머 모델의 어텐션 연산 중 생성된 Key와 Value 행렬을 저장하여 다음 토큰 생성 시 재사용하는 기술이다. 중복 연산을 방지하여 추론 속도를 획기적으로 높이지만, 메모리 점유율이 높다는 특징이 있다.
첫 번째 토큰 생성 시간(TTFT)
사용자의 요청이 입력된 후 모델이 첫 번째 출력 토큰을 생성할 때까지 걸리는 시간이다. 실시간 대화형 서비스에서 사용자 경험을 결정짓는 가장 중요한 지표 중 하나로 꼽힌다.
원격 직접 메모리 접근(RDMA)
CPU를 거치지 않고 네트워크를 통해 한 컴퓨터의 메모리에서 다른 컴퓨터의 메모리로 데이터를 직접 전송하는 기술이다. 낮은 지연 시간과 높은 대역폭을 제공하여 분산 캐시 시스템의 성능을 극대화한다.

기술

  • NVIDIA B200
  • RDMA
  • Distributed KV Cache
  • Prefix Caching

활용 사례

  • 코딩 어시스턴트 (대규모 코드베이스 재사용)
  • 멀티턴 대화형 챗봇
  • 대규모 문서 기반 RAG 시스템
  • 장기 기억을 가진 AI 에이전트
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 11.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.