본문으로 건너뛰기

BlockPilot: 확산 기반 스펙큘레이티브 디코딩을 위한 샘플 적응형 정책 학습

대형 언어 모델의 추론은 토큰 단위의 순차적 특성 때문에 병렬화에 한계가 있고, speculative decoding은 이 병목을 해소해 추론 속도를 높이는 유력한 접근법이다. 기존 확산 기반 블록 제안 방법은 추론 시 고정된 블록 크기를 사용해 입력별로 다른 예측 난이도를 반영하지 못했다. BlockPilot은 prefilling 단계의 마지막 토큰 예측분포를 이용해 샘플별 최적 블록 크기를 예측함으로써 병렬성 활용을 개선하고 실사용 환경에서 유의미한 속도 향상을 달성했다.

용어 해설

스펙큘레이티브 디코딩(Speculative Decoding)
스펙큘레이티브 디코딩은 경량의 drafter가 다수의 후보 토큰을 병렬로 생성하고 대상 모델이 이를 병렬 검증해 수락 가능한 접두사를 받아내는 방식으로, autoregressive 디코딩의 순차 병목을 완전히 보존하면서도 병렬 속도를 얻을 수 있는 추론 가속 기법이다.
확산 언어 모델(Diffusion Language Model)
확산 언어 모델은 마스킹된 토큰을 점진적으로 복원하는 denoising 과정을 통해 블록 단위 병렬 생성이 가능한 모델군으로, block-level diffusion은 여러 토큰을 한 번의 forward로 제안해 speculative decoding에서 높은 병렬성을 제공한다.
블록 확산(Block Diffusion)
블록 확산은 연속된 B개의 토큰을 하나의 블록으로 두고 해당 블록을 denoising하여 병렬로 여러 토큰을 생성하는 기법으로, autoregressive 특성을 유지하면서도 한 스텝당 여러 토큰을 제안할 수 있어 추론 병렬화에 핵심 역할을 한다.
prefilling 표현(Prefilling Representation)
prefilling 표현은 대상 LLM의 prefilling 단계에서 마지막 위치에 대한 예측 확률 분포로, 전체 문맥을 반영한 요약 신호로써 블록 크기 선택과 같은 인스턴스별 결정에 유효한 특징 벡터로 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.