용어 해설
- 스펙큘레이티브 디코딩(Speculative Decoding)
- — 스펙큘레이티브 디코딩은 경량의 drafter가 다수의 후보 토큰을 병렬로 생성하고 대상 모델이 이를 병렬 검증해 수락 가능한 접두사를 받아내는 방식으로, autoregressive 디코딩의 순차 병목을 완전히 보존하면서도 병렬 속도를 얻을 수 있는 추론 가속 기법이다.
- 확산 언어 모델(Diffusion Language Model)
- — 확산 언어 모델은 마스킹된 토큰을 점진적으로 복원하는 denoising 과정을 통해 블록 단위 병렬 생성이 가능한 모델군으로, block-level diffusion은 여러 토큰을 한 번의 forward로 제안해 speculative decoding에서 높은 병렬성을 제공한다.
- 블록 확산(Block Diffusion)
- — 블록 확산은 연속된 B개의 토큰을 하나의 블록으로 두고 해당 블록을 denoising하여 병렬로 여러 토큰을 생성하는 기법으로, autoregressive 특성을 유지하면서도 한 스텝당 여러 토큰을 제안할 수 있어 추론 병렬화에 핵심 역할을 한다.
- prefilling 표현(Prefilling Representation)
- — prefilling 표현은 대상 LLM의 prefilling 단계에서 마지막 위치에 대한 예측 확률 분포로, 전체 문맥을 반영한 요약 신호로써 블록 크기 선택과 같은 인스턴스별 결정에 유효한 특징 벡터로 사용된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



