용어 해설
- Mixture-of-Experts(MoE)(Mixture-of-Experts (MoE))
- — MoE는 동일한 입력에 대해 여러 개의 expert FFN 중 소수만을 활성화하는 아키텍처로서, 전체 파라미터 수를 늘리면서도 각 토큰의 연산량을 낮춘다. 각 토큰은 MoE gate의 상위 k개 expert로 디스패치되며, 이 때문에 배치가 여러 expert로 분산되면 메모리 대역폭 비용이 증가한다. 본문에서는 MoE의 decode 단계에서 활성화된 서로 다른 expert들의 합집합 크기가 지연(latency)을 좌우하는 핵심 요인으로 다뤄진다.
- Prefill-Decode 분리(Prefill-Decode disaggregation)
- — Prefill-Decode 분리는 프롬프트 처리(prefill)와 토큰 생성(decode)을 서로 다른 워커 풀에서 수행해 단계 간 자원 간섭을 제거하는 서빙 토폴로지이다. Prefill은 병렬 계산 중심이고 Decode는 순차적이며 메모리 대역폭 민감성이 커서 분리가 성능과 SLO에 유리하다. 본문에서는 이 분리 환경에서 디코드 라우팅 결정이 지연에 미치는 영향과 ELDR의 적용 지점을 다룬다.
- KV 캐시(KV cache)
- — KV 캐시는 이미 계산된 토큰의 키·값 상태를 블록 단위로 보관해 동일 또는 유사 프롬프트에서 prefill을 건너뛰게 하는 구조이다. Prefix 캐시 히트가 있으면 일부 블록은 재사용되어 prefill이 생략되고, 이로 인해 해당 블록에서의 gate 계산 결과가 즉시 관찰되지 않는다. ELDR는 이 블록 단위 수명과 코인덱스된 시그니처 캐시로 일관된 라우팅 신호를 복구한다.
- Expert Parallelism(EP)(Expert Parallelism (EP))
- — Expert Parallelism은 MoE의 expert를 여러 GPU에 분산해 메모리 요구를 줄이고 대형 모델을 실행하는 방식이다. EP 환경에서는 클러스터별로 활성화되는 hot expert가 한 랭크에 몰리면 병목이 발생하므로, ELDR는 대형 배포에서 클러스터별 expert 배치를 추가로 조정해 EP 부하를 균등화했다. 본문은 EP와 라우팅을 함께 고려한 배치 방식을 기술한다.
- 시그니처 캐시(Signature cache)
- — 시그니처 캐시는 KV 캐시 블록과 같은 인덱스로 각 블록의 prefill-time expert 지문을 저장하는 테이블이다. 블록 단위 행을 합산하면 요청 전체의 expert signature가 복원되어 부분 히트, 완전 히트, 블록 교체 상황에서 시그니처 일관성이 유지된다. 이 설계는 prefix 캐시와 조합해 재연산 없이 라우팅에 필요한 신호를 제공한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.








