용어 해설
- 추측 샘플링(Speculative Decoding)
- — 가벼운 보조 모델(Drafter)이 여러 토큰을 미리 제안하고, 거대한 타겟 모델이 이를 한 번에 병렬로 검증하여 LLM의 추론 속도를 높이는 기법이다. 타겟 모델의 출력 분포를 유지하면서도 순차적인 생성 병목을 해결하는 핵심 최적화 기술이다.
- 수락 길이(Acceptance Length)
- — 추측 샘플링에서 보조 모델이 제안한 토큰들 중 타겟 모델에 의해 최종적으로 승인된 연속된 토큰의 평균 개수이다. 이 수치가 높을수록 보조 모델이 타겟 모델의 예측을 잘 모사하고 있음을 의미하며, 전체 시스템의 가속 성능과 직결된다.
- 증류 손실(Distillation Loss)
- — 타겟 모델(교사)의 지식을 보조 모델(학생)에게 전달하기 위해 두 모델의 출력 확률 분포 차이를 계산하는 손실 함수이다. 보조 모델이 타겟 모델의 복잡한 예측 패턴을 더 적은 파라미터로 효율적으로 학습하게 돕는다.
코드 예제
def _merge_trees(
draft_tokens1, retrieve_indices1, tree_mask1, tree_pos1,
draft_tokens2, retrieve_indices2, tree_mask2, tree_pos2,
):
n1 = draft_tokens1.shape[1] - 1
n2 = draft_tokens2.shape[1] - 1
N = n1 + n2 + 1
// ...(중략)
merged_draft = torch.cat([draft_tokens1, draft_tokens2[0, 1:][None]], dim=1)
merged_mask = torch.zeros(N, N, device=device, dtype=dtype)
merged_mask[0, 0] = 1.0
merged_mask[1:n1 + 1, :n1 + 1] = tree_mask1[0, 0, 1:, :]
merged_mask[n1 + 1:, 0] = 1.0
merged_mask[n1 + 1:, n1 + 1:] = tree_mask2[0, 0, 1:, 1:]
// ...(중략)
return merged_draft, merged_retrieve, merged_mask, merged_pos두 개의 서로 다른 보조 모델이 생성한 토큰 트리를 하나의 병합된 트리 구조로 합쳐 타겟 모델이 한 번에 검증할 수 있게 만드는 핵심 로직
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.