TL;DR
대형 언어 모델의 추론은 토큰 단위의 순차적 특성 때문에 병렬화에 한계가 있고, speculative decoding은 이 병목을 해소해 추론 속도를 높이는 유력한 접근법이다. 기존 확산 기반 블록 제안 방법은 추론 시 고정된 블록 크기를 사용해 입력별로 다른 예측 난이도를 반영하지 못했다. BlockPilot은 prefilling 단계의 마지막 토큰 예측분포를 이용해 샘플별 최적 블록 크기를 예측함으로써 병렬성 활용을 개선하고 실사용 환경에서 유의미한 속도 향상을 달성했다.
왜 중요한가
대형 언어 모델의 추론은 토큰 단위의 순차적 특성 때문에 병렬화에 한계가 있고, speculative decoding은 이 병목을 해소해 추론 속도를 높이는 유력한 접근법이다. 기존 확산 기반 블록 제안 방법은 추론 시 고정된 블록 크기를 사용해 입력별로 다른 예측 난이도를 반영하지 못했다. BlockPilot은 prefilling 단계의 마지막 토큰 예측분포를 이용해 샘플별 최적 블록 크기를 예측함으로써 병렬성 활용을 개선하고 실사용 환경에서 유의미한 속도 향상을 달성했다.
핵심 기여
블록 크기(block size)를 학습 가능한 디코딩 정책 변수로 규정
논문은 기존에 고정값으로 처리되던 추론 블록 크기가 입력별로 최적값이 다름을 실증했다. 데이터셋 전반에 대해 블록 크기 탐색을 수행해 최적 블록 크기가 샘플마다 변동하며 훈련 블록 크기와 일치하지 않는 경우가 상당함을 보였다. 이 관찰은 블록 크기 선택을 정적 하이퍼파라미터가 아니라 학습 가능한 정책 문제로 재정의할 근거가 된다.
최적 블록 크기의 지역성(local interval) 구조 규명
샘플별 최적 블록 크기는 훈련에 사용된 블록 크기 주변의 좁은 구간에 강하게 집중하는 경향을 보였다. 실험에서 대부분의 경우 B−3에서 B+3 범위 내에 최적값이 존재했으며, 이 성질은 전체 크기 탐색을 지역 이산 분류 문제로 축소시켰다. 이로 인해 실시간 최적화 대신 경량 분류기만으로도 효율적인 블록 선택이 가능해졌다.
BlockPilot: prefilling 분포 기반의 샘플 적응형 블록 크기 예측기 설계 및 검증
BlockPilot은 대상 LLM의 prefilling 단계 마지막 위치에서 얻은 전체 예측 확률 분포를 입력으로 받는 경량 MLP 분류기를 학습해 인스턴스별 블록 크기를 예측한다. 이 예측은 한 번만 수행되며 추론 파이프라인을 변경하지 않아 손쉽게 통합되며, 실험에서 Qwen3-4B 기준 평균 수락 길이 5.92와 4.20× 속도향상을 달성했다. 제안한 모듈은 메모리와 지연면에서 미미한 오버헤드만 추가했다.
핵심 아이디어 이해하기
스펙큘레이티브 디코딩의 효율성은 한 번의 검증 단계에서 수락되는 평균 토큰 수인 acceptance length에 의해 지배된다. diffusion 기반의 블록 제안은 한 forward로 여러 토큰을 생성해 병렬성을 크게 높이지만, 블록 크기 B가 커질수록 예측 오차가 누적되어 acceptance가 떨어질 가능성이 있다. 따라서 효율은 draft/verify의 비용과 τ(B)의 상호작용에 의해 결정되므로 적절한 B 선택이 중요하다.
관련 Figure

이 그림은 많은 샘플이 훈련 블록 크기와 불일치하는 최적 블록 크기를 가지며 고정 블록 전략의 한계를 실증한다. 데이터셋별로 B*==B인 비율이 일정하지 않아 샘플 적응의 필요성이 명확히 드러난다. 논문에서 제시한 첫 번째 발견(Instance-wise Variability)을 직관적으로 보강하는 근거 자료이다.
다수 데이터셋에서 훈련 블록 크기 B와 샘플별 최적 블록 크기 B*의 일치 여부 비율을 막대그래프로 나타낸 그림이다.

이 그림은 최적 블록 크기의 지역성(local interval) 성질을 보여주며 대부분의 샘플이 B 주변의 좁은 구간에 분포함을 확인시킨다. 결과적으로 전체 탐색을 지역 이산 분류 문제로 축소할 수 있는 근거가 된다.
훈련 블록 크기 주변에서의 단일 봉우리를 보이는 unimodal 분포 예시를 히스토그램과 피팅 커브로 시각화한 그림이다.

이 그림은 지역성은 유지되지만 어떤 경우에는 bimodal한 패턴이 발생해 단일 최적값 대신 두 개의 유망 후보가 존재할 수 있음을 시사한다. 이러한 다양성은 분류기 입력으로 전체 예측 분포를 사용해야 하는 이유와 후보 반경 k 선택의 중요성을 보강한다.
훈련 블록 크기 주변에서 양쪽에 피크가 있는 bimodal 분포 예시를 히스토그램과 피팅 커브로 나타낸 그림이다.
방법론
논문은 우선 블록 크기 후보 집합을 훈련에 사용한 블록 크기 B를 중심으로 한 지역 이웃 {B−k,...,B+k}로 제한해 문제를 정식화했다. 각 샘플에 대해 prefilling 단계의 마지막 위치에서 예측 분포 p(x)를 추출하고 오프라인 열거(enumeration)로 각 후보 b에 대한 실제 acceptance length τ(b;x)를 측정해 최적 블록 크기 B*(x)를 레이블로 확보했다. 이후 이 (p(x),B*(x)) 쌍을 사용해 얕은 MLP 분류기를 학습해 추론 시 한 번의 호출로 인스턴스별 블록 크기를 예측하도록 했다.
주요 결과
광범위한 실험에서 BlockPilot은 DFlash 등 고정 블록 기법을 일관되게 능가했다. Qwen3-4B 기준으로 온도 1에서 평균 acceptance length 5.92와 4.20× 속도향상을 기록했으며, Qwen3-8B에서도 유의한 향상을 보였다. 어블레이션에서 예측기 깊이·폭·입력 전처리·반경 k의 선택이 성능에 영향을 주었고, 기본 설정(L=2, hidden=2048, k=2, 원본 분포 입력)이 균형점으로 채택되었다.
기술 상세
전체 아키텍처는 대상 LLM의 prefilling 단계에서 마지막 토큰의 예측 확률 분포 p(x)를 추출하고 이를 입력으로 받는 얕은 n-layer MLP 분류기로 구성된다. 이 MLP는 입력 확률 벡터에 대해 softmax 기반의 후보 블록 크기 집합 ℬ에 대한 logits를 출력하며 argmax로 최종 블록 크기를 선택한다. 수식적으로 예측기는 P(b|x)=exp(o_b)/Σ_{b'∈ℬ}exp(o_{b'})를 계산하고 교차엔트로피 손실을 최소화하며 학습된다.
한계점
논문은 후보 반경 k를 확장하면 후보 커버리지는 늘어나지만 분류 난이도도 증가해 예측 성능이 저하될 수 있음을 실험적으로 보였다. 오프라인 레이블 생성은 후보별 speculative decoding을 병렬화하면 실용적이나 초기 데이터 수집 비용이 존재한다는 점이 언급되었다. 또한 diffusion 기반 drafter 자체가 많은 denoising 단계 또는 대형 초안 모델을 요구하는 기존 접근의 한계를 완전히 제거하지는 못한다는 배경이 기술되었다.
실무 활용
BlockPilot은 기존 diffusion 기반 speculative decoding 파이프라인에 거의 변경 없이 통합 가능한 경량 모듈로 설계되어 실무 적용성이 높다. 예측기는 한 번의 prefilling 출력만 필요로 해 추론 흐름을 바꾸지 않으며, 테이블에서 보인 바와 같이 latency는 밀리초 단위로 유지된다. GitHub 저장소가 공개되어 있어 코드·모델 연동 및 재현이 가능하다.
- 대형 모델을 서비스하는 API 환경에서 요청별 생성 지연을 줄여 전체 처리량을 개선하는 추론 가속 파이프라인으로 적용할 수 있다.
- 코드 생성이나 수학 문제처럼 문맥 제약이 강한 시나리오에서 블록 병렬성을 더 적극적으로 활용해 비용 대비 처리량을 높이는 용도로 사용 가능하다.
- 다양한 모델 규모(Qwen3 시리즈, Llama 계열 등)에서 미세한 블록 선택 정책을 적용해 고정 블록 전략보다 안정적인 속도 향상을 얻는 실무 도구로 활용할 수 있다.
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Speculative Decoding
- — 스펙큘레이티브 디코딩은 경량의 drafter가 다수의 후보 토큰을 병렬로 생성하고 대상 모델이 이를 병렬 검증해 수락 가능한 접두사를 받아내는 방식으로, autoregressive 디코딩의 순차 병목을 완전히 보존하면서도 병렬 속도를 얻을 수 있는 추론 가속 기법이다.
- Diffusion Language Model
- — 확산 언어 모델은 마스킹된 토큰을 점진적으로 복원하는 denoising 과정을 통해 블록 단위 병렬 생성이 가능한 모델군으로, block-level diffusion은 여러 토큰을 한 번의 forward로 제안해 speculative decoding에서 높은 병렬성을 제공한다.
- Block Diffusion
- — 블록 확산은 연속된 B개의 토큰을 하나의 블록으로 두고 해당 블록을 denoising하여 병렬로 여러 토큰을 생성하는 기법으로, autoregressive 특성을 유지하면서도 한 스텝당 여러 토큰을 제안할 수 있어 추론 병렬화에 핵심 역할을 한다.
- Prefilling Representation
- — prefilling 표현은 대상 LLM의 prefilling 단계에서 마지막 위치에 대한 예측 확률 분포로, 전체 문맥을 반영한 요약 신호로써 블록 크기 선택과 같은 인스턴스별 결정에 유효한 특징 벡터로 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.