이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.
TL;DR
대규모 언어 모델 추론에서는 토큰을 하나씩 생성하는 자동회귀 디코딩이 지연을 키우며, Speculative Decoding은 drafter가 여러 토큰을 먼저 만든 뒤 target 모델이 한 번에 검증해 이 비용을 줄입니다. 기존 방식은 두 모델이 같은 vocabulary를 사용해야 해서 적합한 drafter가 제한되고 별도 학습이 필요했지만, 이 논문은 서로 다른 vocabulary를 지원하는 세 가지 무손실 알고리즘을 제안합니다. 알고리즘은 추가 학습이나 모델 수정 없이 기성 모델을 사용할 수 있으며, 요약·프로그래밍·긴 문맥 작업에서 표준 자동회귀 디코딩보다 최대 2.8배 빠른 결과를 보였습니다. 이를 통해 drafter 선택 폭을 넓히면서도 target 모델의 출력 분포를 유지하는 추론 가속 구성이 가능해졌습니다.
섹션별 상세
기존 Speculative Decoding은 drafter와 target 모델이 같은 vocabulary를 공유해야 하므로 사용할 수 있는 drafter가 제한됐고, 실용적인 구성을 위해 별도 drafter를 처음부터 학습해야 하는 경우가 많았습니다. 이 연구의 핵심은 토큰 집합이 서로 다른 기성 모델도 drafter로 활용할 수 있도록 공유 vocabulary 조건을 제거하는 데 있습니다. 그 결과 특정 모델 조합에 종속되지 않고 이미 उपलब्ध한 모델을 추론 가속 파이프라인에 편입할 수 있는 범위가 넓어졌습니다.
논문은 서로 다른 vocabulary를 사용하는 환경에서 작동하는 세 가지 Speculative Decoding 방법을 구성했습니다. 각 방법은 drafter가 여러 토큰을 먼저 생성하고 target 모델이 단일 forward pass에서 후보를 검증하는 흐름을 유지하면서, 두 모델의 토큰 표현 차이를 처리합니다. 추가 학습이나 모델 구조 수정 없이 적용할 수 있고 target distribution을 보존하므로, 속도 향상과 출력 분포의 일관성을 함께 확보하는 방향입니다.
성능 평가는 요약, 프로그래밍, 긴 문맥 작업에서 진행됐으며 표준 자동회귀 디코딩을 기준으로 최대 2.8배의 속도 향상이 관찰됐습니다. 자동회귀 방식이 다음 토큰마다 target 모델을 반복 실행하는 반면, 이 방법은 drafter가 만든 여러 후보를 target 모델의 한 번의 실행으로 검증해 처리 단위를 키웁니다. 작업 유형이 달라지는 조건에서도 속도 개선을 측정했다는 점에서 특정 생성 사례에 한정되지 않는 추론 가속 가능성을 확인할 수 있습니다.
용어 해설
- 추측 디코딩(Speculative Decoding)
- — 추측 디코딩은 작은 drafter 모델이 여러 토큰을 먼저 생성한 뒤 target 모델이 한 번의 forward pass로 이를 검증하는 추론 가속 기법입니다. 생성 후보를 묶어 처리하므로 토큰마다 target 모델을 반복 실행하는 자동회귀 방식보다 지연을 줄일 수 있지만, 기존 방식은 두 모델의 vocabulary가 같아야 했습니다.
- 이기종 어휘(Heterogeneous Vocabularies)
- — 이기종 어휘는 drafter 모델과 target 모델이 서로 다른 토큰 집합과 분할 방식을 사용하는 상태를 뜻합니다. 기존 Speculative Decoding은 동일한 vocabulary를 요구해 사용할 수 있는 drafter가 제한됐지만, 이 연구는 어휘가 달라도 target 모델의 출력 분포를 보존하는 검증 절차를 목표로 합니다.
- 자동회귀 디코딩(Autoregressive Decoding)
- — 자동회귀 디코딩은 앞서 생성한 토큰을 입력에 차례로 추가하면서 다음 토큰을 한 번에 하나씩 예측하는 방식입니다. target 모델의 forward pass가 토큰 수만큼 반복되므로 긴 문장이나 긴 문맥에서 추론 시간이 커지며, 논문은 이 방식을 비교 기준으로 삼아 최대 2.8배의 속도 향상을 측정했습니다.
- target 분포(Target Distribution)
- — target 분포는 최종적으로 사용할 대형 모델이 다음 토큰에 부여하는 확률 분포입니다. 무손실 Speculative Decoding은 drafter가 먼저 만든 후보를 target 모델이 검증하고 필요한 경우 조정해 최종 출력이 일반적인 target 모델 추론과 같은 분포를 따르도록 보장합니다.
기술
- LLMs
- Speculative decoding
- autoregressive decoding
활용 사례
- 텍스트 요약
- 코드 생성
- 긴 문맥 작업
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 09. 06.수집 2026. 09. 06.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.