본문으로 건너뛰기
AWS ML Blog조회 1

Amazon SageMaker HyperPod에서 분리된 Prefill-Decode 추론 구현

긴 컨텍스트와 고동시성 스트리밍 워크로드에서 Prefill과 Decode를 서로 다른 GPU 풀로 분리하고 EFA RDMA로 KV 캐시를 전송하면 토큰 생성 지연과 꼬리 지연을 줄일 수 있다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

긴 컨텍스트와 고동시성이 결합된 스트리밍 워크로드에서는 Prefill(입력 전체를 병렬 처리해 KV 캐시를 생성)과 Decode(한 토큰씩 생성하며 KV를 반복 참조)를 동일 GPU에서 처리하면 프롬프트 하나가 모든 동시 요청의 토큰 생성을 지연시키는 병목이 발생한다. Disaggregated Prefill and Decode(DPD) 방식은 Prefill과 Decode를 서로 다른 GPU 풀로 분리하고 LMCache를 통해 KV 캐시를 EFA 기반 RDMA로 전송해 각 단계에 적합한 병렬 전략과 자원 튜닝을 허용한다. 이 접근은 TTFT와 토큰 간 지연을 독립적으로 조정할 수 있게 하고 긴 프리필이 다른 디코드 요청을 막는 현상을 제거하며, 구현은 vLLM과 HyperPod Inference Operator 위에서 LMCache/NIXL/EFA 스택을 활용해 이루어진다. 단, RDMA 전송의 고정 비용 때문에 입력이 짧고 동시성이 낮은 워크로드에서는 colocated 배포가 더 효율적일 수 있다.

섹션별 상세

01
동시에 Prefill과 Decode를 같은 GPU에서 실행하면 긴 프롬프트가 들어올 때 모든 동시 요청의 토큰 생성이 지연되는 병목이 발생한다. 이 글은 Prefill을 계산 집약적으로, Decode를 메모리 대역폭 중심으로 규정하고 두 단계를 서로 다른 GPU 풀에서 실행하도록 분리하는 Disaggregated Prefill and Decode(DPD)를 제안한다. DPD는 KV 캐시를 노드 간에 EFA 기반 RDMA로 전송해 Prefill이 생성한 KV 텐서를 Decode 노드가 직접 참조하게 하고, 이를 통해 첫 토큰 응답 시간(TTFT)과 토큰 간 지연(ITL)을 독립적으로 조정할 수 있다고 기술한다. 이러한 분리는 긴 컨텍스트 프리필이 진행 중일 때 다른 요청의 토큰 생성이 막히는 문제를 근본적으로 제거한다.
02
구체적인 구현은 vLLM을 기반으로 HyperPod Inference Operator와 LMCache를 결합해 이루어진다. 아키텍처는 라우터가 요청을 Prefill 노드와 Decode 노드로 지능적으로 분배하고 LMCache가 NIXL을 통해 KV 캐시를 EFA RDMA로 전송하는 방식으로 동작하며, vLLM의 연속 배칭과 PagedAttention 기능이 단일 노드 효율을 높이는 역할을 한다. 운영 관점에서 DPD는 최소 한 대의 Prefill 노드와 한 대의 Decode 노드, 그리고 RDMA를 지원하는 EFA 네트워킹을 요구하며, 짧은 프롬프트 위주의 저동시성 워크로드에서는 KV 전송의 고정 비용이 이득을 상쇄할 수 있어 colocated 배포가 더 단순하고 효율적일 수 있다고 명시한다. 이 때문에 단일 엔드포인트가 라우팅 임계값을 기준으로 자동으로 장·단점을 판단해 짧은 요청은 디코더로 직접 보내는 설계를 채택한다.
아키텍처 다이어그램은 Prefill 인스턴스와 Decode 인스턴스를 분리하고 LMCache를 통해 EFA RDMA로 KV 캐시를 전송하는 흐름을 시각적으로 표현하고 있다.
Diagram이미지는 Prefill 노드가 입력 프롬프트를 병렬로 처리해 KV 캐시를 생성하고 LMCache가 NIXL/EFA 경로로 KV를 전송한 뒤 Decode 노드가 이를 이용해 토큰을 한 단계씩 생성하는 전체 플로우를 단계별로 보여준다. 또한 라우터가 요청을 지능적으로 Prefill 또는 Decode로 보낸다는 점과, Prefill이 계산 집약적이고 Decode가 메모리 대역폭 중심이라는 아키텍처 상 구분을 시각적으로 강조하고 있다.

용어 해설

키-값 캐시(KV Cache)
모델의 self-attention 연산에서 생성되는 키와 값(tensor)들을 계층별로 저장한 구조로, Prefill 단계가 완료되면 Decode 단계에서 토큰 생성 시 반복해서 참조되어야 하므로 빠른 전송과 높은 메모리 대역폭이 중요하다.
프리필(Prefill)
입력 프롬프트의 모든 토큰에 대해 병렬로 self-attention과 관련 행렬 연산을 수행하여 각 레이어의 KV 텐서를 생성하는 단계로서, 계산 집약적이며 초기 TTFT를 결정하는 핵심 과정이다.
디코드(Decode)
생성할 토큰을 한 번에 하나씩 출력하면서 증가하는 KV 캐시를 반복적으로 참조하는 단계로서, 메모리 대역폭과 지연 민감도가 높아 한 번에 많은 동시 요청이 있을 때 병목이 발생하기 쉬운 과정이다.
Elastic Fabric Adapter (RDMA)(EFA RDMA)
네트워크 수준에서 원격 직접 메모리 접근(Remote Direct Memory Access)을 제공하는 AWS EFA의 기능으로, 노드 간 KV 캐시와 대용량 텐서를 복사할 때 CPU 개입을 최소화해 높은 대역폭과 낮은 지연을 확보한다.
PagedAttention
vLLM이 사용하는 메모리 최적화 기법으로, KV 캐시를 페이징 방식으로 관리해 단일 노드의 메모리 한계를 완화하고 연속 배칭과 결합해 단일 노드 처리 효율을 높이는 역할을 한다.

기술

  • vLLM
  • LMCache
  • EFA RDMA
  • SageMaker HyperPod
  • HyperPod Inference Operator
  • NIXL

활용 사례

  • 긴 문맥을 자주 요구하는 스트리밍 채팅 어시스턴트
  • 에이전트 파이프라인에서의 동시 토큰 스트리밍
  • 대규모 문서 분석 엔드포인트에서의 긴 컨텍스트 처리
  • RAG(검색 증강 생성)로 대용량 검색 결과를 컨텍스트로 사용하는 응용
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 11.수집 2026. 07. 11.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.