TL;DR
PD(Prefill–Decode) 분리 서빙에서 MoE 모델의 디코드 지연은 활성화되는 서로 다른 expert들의 합집합 크기에 지배된다. 이 합집합은 동일 도메인 요청끼리 모으면 작아지고, prefill 단계에서 이미 gate가 실행되므로 디코드 라우팅 시점에 그 신호를 읽을 수 있다. ELDR는 이 신호를 라우팅에 활용해 중간 및 극단 지연을 감소시켰다는 점에서 실무적 비용·지연 개선을 가져온다.
왜 중요한가
PD(Prefill–Decode) 분리 서빙에서 MoE 모델의 디코드 지연은 활성화되는 서로 다른 expert들의 합집합 크기에 지배된다. 이 합집합은 동일 도메인 요청끼리 모으면 작아지고, prefill 단계에서 이미 gate가 실행되므로 디코드 라우팅 시점에 그 신호를 읽을 수 있다. ELDR는 이 신호를 라우팅에 활용해 중간 및 극단 지연을 감소시켰다는 점에서 실무적 비용·지연 개선을 가져온다.
관련 Figure

언어별 편중은 locality-only 라우팅이 특정 디코더로 트래픽을 과도하게 집중시키는 위험을 키우며, 이는 non-MoE 연산 부하를 증가시켜 꼬리 지연을 악화시킬 수 있음을 시사한다. ELDR는 이러한 구조적 스큐를 오프라인 균형 군집화와 온라인 로드 체크로 조절해 과부하를 방지하도록 설계되었다.
WildChat 요청은 영어와 중국어가 전체의 약 75%를 차지하는 등 언어별 트래픽 스큐가 매우 심하다.
핵심 기여
전문가 지역성(expert locality)을 디코드 라우팅 축으로 규정
MoE 디코드 지연은 배치의 토큰 수가 아니라 한 단계에서 로드되는 서로 다른 expert 수에 의해 결정된다는 점을 계량적으로 보여주었다. 동일 도메인(batch)이 혼합 도메인 대비 활성 expert를 평균 17–21% 적게 활성화한다는 실험 결과를 제시했다. 이러한 관찰은 사전(prefill)에서 획득한 expert 활성화가 디코드 시점의 활성화와 상관관계(0.70–0.92)를 가지므로 라우팅 신호로 실용적임을 증명했다.
ELDR: signature 기반의 locality-band 라우팅과 균형 군집화 파이프라인
각 요청의 prefill expert activation으로부터 IDF 가중, 계층 마스크, L2 정규화로 이루어진 compact expert signature를 생성한다. 오프라인에서는 Hungarian-balanced K-means로 시그니처 공간을 균형 있게 분할해 각 디코더에 하나의 centroid를 할당하고, 온라인에서는 가까운 centroid 집합(지역성 밴드) 내에서 가장 적게 로드된 워커로 라우팅한다. τ=0.1의 locality-band가 top-1과 순수 load-balancing의 균형을 실험적으로 달성했으며, 이 조합은 출력 정확성에 영향을 주지 않으면서 TPOT을 줄였다.
블록 단위의 prefix-cache-coherent 시그니처 캐시와 vLLM 통합 구현
KV 캐시 블록과 동일한 인덱스로 시그니처를 저장해 부분 히트와 완전 히트, 블록 교체 상황에서 요청 시그니처의 합으로 원본 시그니처를 정확히 복원한다. 이 캐시는 GPU 메모리에서 블록당 int8로 저장되어 전체 크기가 KV 캐시의 1% 미만으로 유지된다. 구현은 vLLM 위에 라우팅 프록시와 prefill 훅을 추가하는 방식으로 이루어져 실제 배포(최대 40 GPU)에서 오버헤드가 미미함을 보였다.
핵심 아이디어 이해하기
대형 MoE 모델의 decode 단계는 각 토큰이 선택하는 소수의 expert 때문에 배치가 여러 expert로 분산되면 메모리 대역폭 비용이 지배적이라는 사실이 출발점이다. 동일 도메인의 요청은 gate가 유사한 expert를 반복 선택하므로 같은 워커에 모으면 한 단계당 불러오는 서로 다른 expert 수가 줄어들어 디코드 비용이 감소한다. 실험에서 활성 expert 수가 16에서 128로 늘면 단일 MoE 레이어 지연이 4.7배 증가하는 등 활성 expert 수가 지연을 강하게 결정한다.
관련 Figure

scatter plot은 각 expert에 대해 prefill 활성화와 decode 활성화가 대각선 근처에 밀집함을 보여 prefill 신호로 디코드 활성화를 예측할 수 있음을 입증한다. 모델별 상관계수(r)는 0.70에서 0.92 사이로 보고되어 ELDR가 prefill 시그니처를 라우팅 입력으로 사용하는 근거가 된다. 이 시각 증거는 시그니처 설계 및 오프라인 캘리브레이션의 정량적 목표를 정하는 데 활용되었다.
prefill 단계의 expert 활성화와 decode 단계의 expert 활성화가 각 expert 수준에서 강한 상관관계를 보인다.
방법론
ELDR는 오프라인 캘리브레이션과 온라인 라우팅의 두 단계로 동작한다. 오프라인 단계에서 1,000개의 캘리브레이션 요청을 prefill하여 각 요청의 레이어별 expert 카운트를 수집하고, IDF로 흔한 expert를 내려잡은 뒤 greedy layer selection으로 정보량이 큰 레이어만 골라 L2 정규화된 시그니처 벡터를 만든다. 이 시그니처들을 Hungarian-balanced K-means로 군집화해 각 디코더에 하나의 균형 잡힌 centroid를 할당한다.
관련 Figure

다이어그램은 시그니처가 prefill 훅에서 블록 단위로 수집되어 KV 캐시와 함께 저장되고, 핸드오프 시 합산되어 라우터에 전달되는 흐름을 명확히 보여준다. 또한 offline fit으로 centroid를 생성하고 온라인에서 밴드 기반으로 로컬리티와 로드를 결합해 워커를 선택하는 제어 흐름이 구현 관점에서 어떻게 최소 침투로 서비스에 추가되는지를 보여준다.
ELDR 아키텍처 다이어그램은 오프라인 캘리브레이션, 시그니처 캐시, 로컬리티-밴드 라우팅, 그리고 기존 PD 파이프라인과의 통합 지점을 보여준다.
주요 결과
주요 실험은 Qwen3-30B-A3B, GPT-OSS-120B, Gemma-4-26B-A4B 세 모델과 task·language 두 워크로드에서 수행되었다. ELDR는 task 워크로드에서 최적의 로드밸런서 대비 median TPOT을 7.0–13.9% 줄였고 언어 워크로드에서는 5.9–10.0% 절감을 기록했다. 추가 실험으로 signature 구성 요소와 클러스터링 균형, locality-band 폭을 검증했고 discrete count⋅idf 시그니처와 Hungarian-balanced K-means, τ=0.1 조합이 최종 성능을 견인함을 확인했다.
관련 Figure

이 그림은 active-expert count가 MoE 디코드 지연을 지배함을 실험적으로 확인한다. 같은 배치 크기에서 활성 expert 수를 16에서 128로 늘리면 지연이 수배로 증가하는 패턴이 관찰되어 라우팅이 활성 expert의 합집합을 줄이는 방향으로 설계되어야 함을 뒷받침한다. ELDR는 이 관찰에 기반해 prefill에서 예측 가능한 expert 지문을 사용해 요청을 군집화한다.
단일 MoE 레이어에서 활성된 expert 수가 늘어날수록 단일 스텝 지연이 크게 증가하고 배치 크기 변화는 작은 영향을 준다.

이 결과는 도메인별로 expert 사용이 구조화되어 있음을 정량화하며, 동일 도메인 배치가 활성 expert를 17–21% 가량 줄인다는 수치는 ELDR의 기대 이득 범위를 제공한다. 따라서 로드만 고려한 기존 라우팅이 동일 도메인 요청을 흩어뜨리면 불필요한 expert 로드가 발생하는 것이 실험적으로 확인되었다.
같은 도메인으로 구성된 배치가 혼합 도메인 배치보다 한 단계당 활성화하는 서로 다른 expert 수가 적다.
기술 상세
시그니처는 각 레이어 ℓ에서 토큰별 top-k로 선택된 expert의 정수 카운트 c_r(ℓ,e)를 시작점으로 한다. 이 카운트에 대해 df(ℓ,e)를 계산해 IDF w(ℓ,e)=log((|C|+1)/(df(ℓ,e)+1))로 재가중한 뒤, 선택된 레이어 집합 S의 reweighted counts를 이어붙여 x_r를 구성하고 L2 정규화하여 s_r = x_r / ||x_r||_2를 얻는다. 시그니처 품질은 시그니처 간 코사인 거리와 실제 디코드 패턴 간 코사인 거리의 Spearman 순위 상관 ρ로 측정되며, 이 값이 클수록 클러스터링이 디코드-오버랩을 더 잘 예측한다.
관련 Figure

IDF로 가중한 정수 카운트(count⋅idf)가 연속 gate-score 기반 표현들보다 평균 및 최악 사례에서 더 높은 Spearman 순위 상관 ρ를 달성해 시그니처 목표(디코드 오버랩 예측)에 적합함을 정량적으로 뒷받침한다. 이 결과는 ELDR가 discrete top-k 카운트와 IDF, 레이어 마스크를 조합한 설계를 선택한 근거가 된다.
여러 후보 시그니처 변환(count, count⋅idf, sqrt(count), gate prob, gate logit, binary)에 대해 시그니처 품질(ρ)을 비교한 막대그래프이다.

그리디 레이어 선택에서 모든 레이어를 사용할 때보다 적절히 압축된 N* 레이어만 유지하는 편이 시그니처의 예측력을 높여 군집화와 라우팅 품질을 개선한다. 이 실험 결과는 실무에서 시그니처 차원을 줄여 계산·메모리 비용을 낮추면서도 신호 품질을 유지할 수 있음을 보여준다.
유지할 레이어 수에 따라 누적 시그니처 품질(ρ)이 변하는 그래프로, greedily 선택된 상위 N* 레이어에서 성능이 정점을 찍는다.
한계점
ELDR의 성능 이득은 워크로드의 expert 활성화 분리 가능성에 의존한다; 도메인 경계가 모호하거나 시그니처가 약할 경우 이득이 축소될 수 있다. 오프라인 캘리브레이션은 모델, 데이터셋, 혹은 디코더 풀 크기가 변경되면 재실행이 필요하며 캘리브레이션 비용이 존재한다. 런타임 오버헤드는 요청당 약 0.86ms로 보고되었고 시그니처 캐시가 전체 KV 캐시의 1% 미만을 차지하지만 아주 엄격한 TTFT SLO 아래에서는 고려 대상이 될 수 있다.
실무 활용
ELDR는 기존 PD-disaggregated 서빙 스택에 최소한의 변경으로 통합 가능한 라우터 계층으로 구현되어 실무 배포에서 즉시 적용 가능하다. 오프라인 캘리브레이션과 작은 런타임 훅만 추가하면 되므로 서비스 재설계 없이 지연 개선 효과를 얻을 수 있다. 단, 캘리브레이션은 모델·데이터·토폴로지 변경 시 재실행이 필요하다.
- 대형 MoE 모델을 PD 분리 토폴로지로 서빙하는 환경에서 디코드 지연(TPOT) 최적화에 적용할 수 있다.
- 언어·도메인 편향이 존재하는 실세계 트래픽(WildChat 등)에서 동일 도메인 요청의 로컬리티를 활용해 비용 효율을 높일 수 있다.
- 대규모 EP(Expert Parallelism)를 사용하는 배포에서 클러스터별 expert 배치와 결합해 랭크 단위 병목을 완화하는 데 활용할 수 있다.
코드 공개 여부: 비공개
키워드
용어 해설
- Mixture-of-Experts (MoE)
- — MoE는 동일한 입력에 대해 여러 개의 expert FFN 중 소수만을 활성화하는 아키텍처로서, 전체 파라미터 수를 늘리면서도 각 토큰의 연산량을 낮춘다. 각 토큰은 MoE gate의 상위 k개 expert로 디스패치되며, 이 때문에 배치가 여러 expert로 분산되면 메모리 대역폭 비용이 증가한다. 본문에서는 MoE의 decode 단계에서 활성화된 서로 다른 expert들의 합집합 크기가 지연(latency)을 좌우하는 핵심 요인으로 다뤄진다.
- Prefill-Decode disaggregation
- — Prefill-Decode 분리는 프롬프트 처리(prefill)와 토큰 생성(decode)을 서로 다른 워커 풀에서 수행해 단계 간 자원 간섭을 제거하는 서빙 토폴로지이다. Prefill은 병렬 계산 중심이고 Decode는 순차적이며 메모리 대역폭 민감성이 커서 분리가 성능과 SLO에 유리하다. 본문에서는 이 분리 환경에서 디코드 라우팅 결정이 지연에 미치는 영향과 ELDR의 적용 지점을 다룬다.
- KV cache
- — KV 캐시는 이미 계산된 토큰의 키·값 상태를 블록 단위로 보관해 동일 또는 유사 프롬프트에서 prefill을 건너뛰게 하는 구조이다. Prefix 캐시 히트가 있으면 일부 블록은 재사용되어 prefill이 생략되고, 이로 인해 해당 블록에서의 gate 계산 결과가 즉시 관찰되지 않는다. ELDR는 이 블록 단위 수명과 코인덱스된 시그니처 캐시로 일관된 라우팅 신호를 복구한다.
- Expert Parallelism (EP)
- — Expert Parallelism은 MoE의 expert를 여러 GPU에 분산해 메모리 요구를 줄이고 대형 모델을 실행하는 방식이다. EP 환경에서는 클러스터별로 활성화되는 hot expert가 한 랭크에 몰리면 병목이 발생하므로, ELDR는 대형 배포에서 클러스터별 expert 배치를 추가로 조정해 EP 부하를 균등화했다. 본문은 EP와 라우팅을 함께 고려한 배치 방식을 기술한다.
- Signature cache
- — 시그니처 캐시는 KV 캐시 블록과 같은 인덱스로 각 블록의 prefill-time expert 지문을 저장하는 테이블이다. 블록 단위 행을 합산하면 요청 전체의 expert signature가 복원되어 부분 히트, 완전 히트, 블록 교체 상황에서 시그니처 일관성이 유지된다. 이 설계는 prefix 캐시와 조합해 재연산 없이 라우팅에 필요한 신호를 제공한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.