TL;DR
분리형 추론은 Prefill과 Decode를 서로 다른 GPU 풀에서 실행하고 KV Cache를 네트워크로 전달해 TTFT와 TPOT의 간섭을 줄이는 방식입니다. 요청의 입력·출력 길이와 각 단계의 처리율을 이용해 GPU 비율 ϕ를 정하고, fabric 대역폭과 큐 버퍼가 생성되는 KV Cache 흐름을 감당해야 합니다. 충분한 부하와 안정적인 균형 추적이 가능하면 단계별 parallelism, kernel, 메모리 용량을 따로 최적화할 수 있어 통합형 추론과 동일한 기본 처리량에서 추가적인 전문화 이점을 얻습니다. 다만 GPU worker 단위의 반올림 손실, KV Cache 전송 중복, autoscaling 지연과 운영 복잡성이 실제 도입 장벽으로 남습니다.
섹션별 상세
- Prefill GPU 비율은 ϕ=B·ISL/(B·ISL+rP·tstep·OSL)로 산출된다. — ‘How to rate balance’ 절의 요청당 prefill·decode GPU 시간과 균형 배분 공식. 출처
- 충분한 부하와 구현 조건이 갖춰지면 분리형 배포는 통합형 배포보다 결코 나쁘지 않다. — 본문의 ‘The conditions under which we can disaggregate properly’와 ‘Why it’s strictly better, once the conditions are met’ 절에서 세 가지 조건과 전문화 이점을 연결함. 출처
용어 해설
- 분리형 추론(Disaggregated Inference)
- — Prefill과 decode를 서로 다른 GPU 풀에서 실행하고, prefill이 만든 KV cache를 네트워크로 decode 풀에 전달하는 추론 구조입니다. 두 단계의 자원과 SLO를 독립적으로 조정해 서로의 지연 영향을 줄이는 방식입니다.
- Prefill
- — 사용자 prompt 전체를 한 번에 처리해 각 토큰의 KV cache를 생성하는 단계입니다. 계산량이 크고 메모리 접근은 상대적으로 적어 입력 토큰 처리율이 핵심 성능 지표가 됩니다.
- Decode
- — 생성된 KV cache를 이용해 출력 토큰을 한 개씩 순차적으로 생성하는 단계입니다. 실행 중인 sequence를 batch로 묶어 처리하며, batch 크기와 step 시간이 TPOT와 출력 처리량을 결정합니다.
- KV Cache
- — Attention 계산에 필요한 이전 토큰의 key와 value를 저장하는 메모리입니다. Prefill에서 요청 전체에 대해 생성되고 decode에서 반복 사용되므로, 분리형 추론에서는 두 GPU 풀 사이를 이동하는 데이터가 됩니다.
- 첫 토큰 지연시간(Time-to-First-Token (TTFT))
- — 요청이 도착한 뒤 첫 번째 출력 토큰이 생성될 때까지 걸리는 시간입니다. Prefill 대기와 KV cache 전송 시간이 포함되므로, 분리형 구조에서는 prefill 풀의 부하와 버퍼 상태가 주요 영향을 줍니다.
- 출력 토큰당 시간(Time-per-Output-Token (TPOT))
- — 연속된 출력 토큰 사이에 걸리는 시간으로, decode 응답의 지속적인 지연을 나타냅니다. Temporal disaggregation에서 prefill을 위해 decode가 중단되면 TPOT 분위수가 악화되므로 두 단계의 독립 실행이 중요해집니다.
기술
- DistServe
- Splitwise
- SARATHI
- Bullet
- DuetServe
- CUDA green contexts
- DeepSeek’s V3
- DeepEP
- dynamo
- vLLM
- NIXL connector
- SGLang
- Mooncake
- RDMA
- B200
- GLM-5.2
활용 사례
- 대규모 LLM Serving
- TTFT와 TPOT를 독립적으로 조정하는 추론 시스템
- Prefill과 Decode의 GPU 자원 분리
- Attention과 FFN의 가속기 분리
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
