본문으로 건너뛰기

Draft Less, Retrieve More: Speculative Decoding을 위한 하이브리드 트리 구성

동적 깊이 prune은 드래프트 비용을 낮추지만 MAT를 떨어뜨려 Pareto frontier를 굳건히 만든다. Graft는 pruning으로 해방된 예산을 retrieval으로 보충해 동일 예산에서 후보 범위를 확장하고, lossless한 검증 경로를 유지하며 짧은 컨텍스트와 긴 컨텍스트 양쪽에서 실용적 속도 향상을 달성한다. 대형 모델에서의 평균 속도 up to 5.41×를 기록하고, Qwen3-235B에서 EAGLE-3 대비 평균 속도 향상을 최대 21.8% 달성했다. 또한 LLaMA3.1-8B의 장-context에서 3.22×의 평균 속도를 달성하고 Qwen3-14B에서 EAGLE3-64K 대비 16.6%를 넘었다. DFlash와의 확장 가능성에 대한 초기 탐색도 제시한다.

용어 해설

예산 해제(Budget Release)
프래닝에서 제거된 후보 슬롯을 재활용하는 아이디어로, pruning으로 줄인 후보 영역을 retrieval으로 채워 주어 fixed-budget에서 속도와 MAT 사이의 트레이드를 완화시키는 원리이다.
루트 중심 검색(Root-Centered Retrieval)
루트를 기준으로 후보를 우선 탐색하는 retrieval 방식으로, pruning으로 남긴 슬롯의 근접 위치에서 고품질 후보를 채택하도록 설계된 검색 전략이다.
GPU-내 인접 행렬(GPU-Resident Adjacency Matrix)
토큰 간 전이 후보를 top-k 형태로 GPU에 상주시키는 데이터 구조로, root-centered retrieval를 빠르게 수행하고 CPU-최근접 조회를 제거한다.
손실 없는 추측적 디코딩(Lossless Speculative Decoding)
추측 제안이 최종 검증에서 손실 없이 모델 출력 분포를 재현하도록 보장하는 원리로, 제안 토큰의 채택 여부가 타깃 모델의 검증 규칙에 의해 결정된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 19.수집 2026. 05. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.