TL;DR
긴 컨텍스트와 고동시성이 결합된 스트리밍 워크로드에서는 Prefill(입력 전체를 병렬 처리해 KV 캐시를 생성)과 Decode(한 토큰씩 생성하며 KV를 반복 참조)를 동일 GPU에서 처리하면 프롬프트 하나가 모든 동시 요청의 토큰 생성을 지연시키는 병목이 발생한다. Disaggregated Prefill and Decode(DPD) 방식은 Prefill과 Decode를 서로 다른 GPU 풀로 분리하고 LMCache를 통해 KV 캐시를 EFA 기반 RDMA로 전송해 각 단계에 적합한 병렬 전략과 자원 튜닝을 허용한다. 이 접근은 TTFT와 토큰 간 지연을 독립적으로 조정할 수 있게 하고 긴 프리필이 다른 디코드 요청을 막는 현상을 제거하며, 구현은 vLLM과 HyperPod Inference Operator 위에서 LMCache/NIXL/EFA 스택을 활용해 이루어진다. 단, RDMA 전송의 고정 비용 때문에 입력이 짧고 동시성이 낮은 워크로드에서는 colocated 배포가 더 효율적일 수 있다.
섹션별 상세
- DPD는 Prefill과 Decode를 분리하고 KV 캐시를 EFA 기반 RDMA로 전송해 긴 프롬프트가 다른 요청들의 토큰 생성에 미치는 간섭을 제거한다. — 본문 설명 및 'When to use disaggregated inference' 섹션의 동작 원리 설명
- DPD가 특히 유리한 워크로드는 입력 프롬프트가 정기적으로 4,096토큰을 초과하고 여러 동시 사용자 또는 스트리밍 응답을 요구하는 경우이다. — 'When to use disaggregated inference' 섹션의 사용 조건 목록

- DPD는 최소 한 대의 prefill 노드와 한 대의 decode 노드, 그리고 RDMA를 지원하는 EFA 네트워킹을 요구한다. — 본문의 'DPD requires at minimum one prefill node and one decode node with RDMA-capable EFA networking' 문장
용어 해설
- KV Cache
- — 모델의 self-attention 연산에서 생성되는 키와 값(tensor)들을 계층별로 저장한 구조로, Prefill 단계가 완료되면 Decode 단계에서 토큰 생성 시 반복해서 참조되어야 하므로 빠른 전송과 높은 메모리 대역폭이 중요하다.
- Prefill
- — 입력 프롬프트의 모든 토큰에 대해 병렬로 self-attention과 관련 행렬 연산을 수행하여 각 레이어의 KV 텐서를 생성하는 단계로서, 계산 집약적이며 초기 TTFT를 결정하는 핵심 과정이다.
- Decode
- — 생성할 토큰을 한 번에 하나씩 출력하면서 증가하는 KV 캐시를 반복적으로 참조하는 단계로서, 메모리 대역폭과 지연 민감도가 높아 한 번에 많은 동시 요청이 있을 때 병목이 발생하기 쉬운 과정이다.
- EFA RDMA
- — 네트워크 수준에서 원격 직접 메모리 접근(Remote Direct Memory Access)을 제공하는 AWS EFA의 기능으로, 노드 간 KV 캐시와 대용량 텐서를 복사할 때 CPU 개입을 최소화해 높은 대역폭과 낮은 지연을 확보한다.
- PagedAttention
- — vLLM이 사용하는 메모리 최적화 기법으로, KV 캐시를 페이징 방식으로 관리해 단일 노드의 메모리 한계를 완화하고 연속 배칭과 결합해 단일 노드 처리 효율을 높이는 역할을 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


