본문으로 건너뛰기

Prefill-as-a-Service: 차세대 모델의 KV 캐시를 활용한 데이터 센터 간 협업

Moonshot AI와 칭화대가 KV 캐시 전송 효율을 극대화하여 데이터 센터 간 Prefill과 Decode를 분리 서빙하는 PrfaaS 아키텍처를 제안했다.

커뮤니티 반응

대규모 추론 인프라를 운영하는 개발자들 사이에서 하드웨어 비대칭성을 해결할 수 있는 실질적인 아키텍처로 주목받고 있습니다.

주요 논점

01찬성다수

KV 캐시 전송 비용 문제로 묶여있던 Prefill과 Decode를 분리함으로써 하드웨어 효율을 극대화할 수 있다.

합의점 vs 논쟁점

합의점

  • 실제 서비스 환경의 요청은 매우 불규칙하므로 단순 분리보다 정교한 스케줄링이 필수적이다.

논쟁점

  • 일반 Ethernet 환경에서의 안정성이 대규모 트래픽 상황에서도 지속될 수 있는지에 대한 검증이 더 필요하다.

실용적 조언

  • 긴 컨텍스트 처리가 잦은 서비스라면 Prefill 전용 클러스터를 구축하여 TTFT를 개선하는 방안을 검토해야 한다.
  • 하드웨어 도입 시 Prefill용(연산 중심)과 Decode용(대역폭 중심) 가속기를 구분하여 구매함으로써 비용 대비 성능을 최적화할 수 있다.

섹션별 상세

기존의 밀집형 어텐션 모델과 달리 하이브리드 어텐션 구조는 KV 캐시 크기를 획기적으로 줄여준다. 이를 통해 고가의 RDMA 장비 없이 일반 Ethernet 환경에서도 클러스터 간 KV 캐시 전송이 가능해지는 기술적 토대를 마련했다. 실제 1T 파라미터 모델 사례 연구에서 100Gbps 링크 중 13Gbps의 대역폭만 사용하여 데이터 센터 간 전송을 성공적으로 수행했다.
PrfaaS 아키텍처는 Prefill과 Decode 단계를 독립적인 컴퓨팅 클러스터로 분리하여 서빙 효율을 극대화한다. 연산 중심의 Prefill은 고성능 가속기 클러스터에서 처리하고, 결과물인 KV 캐시를 전송받은 Decode 클러스터는 메모리 대역폭에 최적화된 하드웨어에서 실행된다. 이 방식을 통해 기존의 균일한 PD 구조 대비 처리량은 54% 향상되었으며, P90 TTFT 지연 시간은 64% 감소하는 성과를 거두었다.
Moonshot AI와 칭화대학교의 'Prefill-as-a-Service' 논문 초록과 서론 부분의 캡처 이미지이다.
Screenshot논문의 핵심 아이디어인 PrfaaS 아키텍처와 그로 인한 성능 향상 수치(처리량 54% 향상 등)를 명시하고 있다. 특히 KV 캐시 전송 비용 문제를 해결하여 데이터 센터 간 분산 서빙이 가능함을 기술적으로 뒷받침하는 근거 자료로 사용된다.
실제 워크로드의 불규칙한 요청 길이와 버스트 특성을 해결하기 위해 대역폭 및 캐시 인지형 스케줄링 기법을 도입했다. 단순히 Prefill을 외부화하는 것에 그치지 않고 네트워크 상태와 캐시 분포를 고려해 요청을 배치함으로써 큐 대기 시간과 혼잡을 방지한다. 이는 서로 다른 하드웨어를 혼합하여 사용하면서도 대칭적인 자원 할당 없이 독립적인 확장을 가능하게 한다.

용어 해설

Prefill-Decode 분리(PD Disaggregation)
LLM 추론의 두 단계인 Prefill(입력 처리)과 Decode(출력 생성)를 물리적으로 분리된 컴퓨팅 자원에서 실행하는 아키텍처이다. 연산 집약적인 Prefill과 메모리 대역폭 집약적인 Decode를 각각 최적화된 하드웨어에 할당하여 전체 시스템 효율을 극대화한다.
KV 캐시(KV Cache)
Transformer 모델 추론 시 이전 토큰들의 Key와 Value 행렬을 저장해두는 기술이다. 매번 처음부터 다시 계산하는 낭비를 줄여 생성 속도를 높이지만, 컨텍스트가 길어질수록 메모리 점유율과 전송 비용이 급격히 증가하는 특성이 있다.
첫 토큰 생성 시간(TTFT)
사용자의 요청 후 첫 번째 토큰이 출력될 때까지 걸리는 지연 시간(Time To First Token)이다. LLM 서비스의 사용자 경험을 결정하는 핵심 지표로, 주로 Prefill 단계의 연산 속도와 데이터 전송 효율에 의해 결정된다.
원격 직접 메모리 접근(RDMA)
CPU의 개입 없이 네트워크를 통해 다른 컴퓨터의 메모리에 직접 접근하는 기술이다. 초저지연과 고대역폭을 제공하여 기존에는 KV 캐시 전송을 위해 필수적이었으나, 본문에서는 일반 Ethernet으로 이를 대체하는 방안을 다룬다.

언급된 도구

vLLM추천

오픈소스 LLM 추론 및 서빙 프레임워크

SGLang추천

고성능 LLM 서빙 엔진

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 21.수집 2026. 04. 21.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.