본문으로 건너뛰기

TAPS: 추측 샘플링을 위한 작업 인지형 제안 분포 연구

LLM 추론 가속 기법인 추측 샘플링에서 보조 모델의 '학습 데이터 분포'가 성능에 미치는 영향을 최초로 심도 있게 분석했다. 특정 작업에 특화된 보조 모델을 사용하고 이를 추론 시점에 지능적으로 조합함으로써, 기존의 범용 보조 모델보다 훨씬 높은 가속 효율을 달성할 수 있음을 입증했다.

용어 해설

추측 샘플링(Speculative Decoding)
가벼운 보조 모델(Drafter)이 여러 토큰을 미리 제안하고, 거대한 타겟 모델이 이를 한 번에 병렬로 검증하여 LLM의 추론 속도를 높이는 기법이다. 타겟 모델의 출력 분포를 유지하면서도 순차적인 생성 병목을 해결하는 핵심 최적화 기술이다.
수락 길이(Acceptance Length)
추측 샘플링에서 보조 모델이 제안한 토큰들 중 타겟 모델에 의해 최종적으로 승인된 연속된 토큰의 평균 개수이다. 이 수치가 높을수록 보조 모델이 타겟 모델의 예측을 잘 모사하고 있음을 의미하며, 전체 시스템의 가속 성능과 직결된다.
증류 손실(Distillation Loss)
타겟 모델(교사)의 지식을 보조 모델(학생)에게 전달하기 위해 두 모델의 출력 확률 분포 차이를 계산하는 손실 함수이다. 보조 모델이 타겟 모델의 복잡한 예측 패턴을 더 적은 파라미터로 효율적으로 학습하게 돕는다.

코드 예제

python
def _merge_trees(
    draft_tokens1, retrieve_indices1, tree_mask1, tree_pos1,
    draft_tokens2, retrieve_indices2, tree_mask2, tree_pos2,
):
    n1 = draft_tokens1.shape[1] - 1
    n2 = draft_tokens2.shape[1] - 1
    N = n1 + n2 + 1
    // ...(중략)
    merged_draft = torch.cat([draft_tokens1, draft_tokens2[0, 1:][None]], dim=1)
    merged_mask = torch.zeros(N, N, device=device, dtype=dtype)
    merged_mask[0, 0] = 1.0
    merged_mask[1:n1 + 1, :n1 + 1] = tree_mask1[0, 0, 1:, :]
    merged_mask[n1 + 1:, 0] = 1.0
    merged_mask[n1 + 1:, n1 + 1:] = tree_mask2[0, 0, 1:, 1:]
    // ...(중략)
    return merged_draft, merged_retrieve, merged_mask, merged_pos

두 개의 서로 다른 보조 모델이 생성한 토큰 트리를 하나의 병합된 트리 구조로 합쳐 타겟 모델이 한 번에 검증할 수 있게 만드는 핵심 로직

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 28.수집 2026. 04. 01.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.