protoLabsAI/Ornith-1.0-9B-MTP-GGUF
Ornith-1.0-9B MTP GGUF는 MTP nextn 헤드를 트렁크에 통합해 llama.cpp에서 분포 무손실 multi-token speculative decoding을 제공하며 RTX A6000에서 최대 1.73× 추론 속도 향상을 보였다.
학습 방식 · 본 배포는 deepreinforce-ai의 Ornith-1.0-9B 트렁크에 protoLabsAI의 KL-distilled MTP draft head를 graft한 형태로 제작되었다. KL-distillation은 초안 분포를 트렁크 분포에 정렬시키는 방식으로 헤드를 학습하는 데 사용되었으며 초안의 수용률을 높이는 데 기여했다. 헤드는 트렁크에 15개의 텐서를 추가하는 방식으로 통합되어 번들형 GGUF 또는 분리형 draft 파일로 배포될 수 있다.
TL;DR
이 배포는 deepreinforce-ai의 Ornith-1.0-9B 트렁크에 protoLabsAI의 KL-distilled MTP nextn 헤드를 graft해 GGUF 번들과 분리형 draft 헤드를 모두 제공하는 형태로, llama.cpp에서 분포 무손실의 multi-token speculative decoding을 기본 지원한다. 벤치마크는 RTX A6000 환경에서 n-max 3 구성 기준으로 Q8_0에서 122.6 decode tok/s와 1.73×의 처리량 향상을 보고했으며 per-token acceptance 수치가 vLLM 레퍼런스와 근접함이 확인되었다. 다양한 양자화 산출물이 제공되어 VRAM 제약에 따른 트레이드오프를 조절할 수 있고 IQ2_M 등 초저메모리 옵션은 약 5GB 수준의 서빙을 가능하게 했다. 다만 llama.cpp 최소 버전 요구(b9616)와 graft→convert 순서를 지키지 않으면 텐서 불일치 오류가 발생할 수 있어 배포 전 변환 절차를 엄격히 따라야 한다.
핵심 포인트
- 트렁크에 KL-distilled MTP nextn 헤드를 graft한 번들형 GGUF를 제공해 llama.cpp에서 별도 드래프트 모델 없이도 lossless multi-token speculative decoding을 즉시 실행할 수 있게 한 배포 방식이 차별점이다. 이 접근은 번들형과 분리형 두 가지 배포 경로를 모두 지원해 배포 유연성을 높였다. 결과적으로 사용자 환경에 따라 번들 파일을 선택하거나 헤드만 추가해 운용할 수 있다.
- 벤치마크에서 보고된 per-token acceptance가 vLLM 레퍼런스와 근접한 수치(0.766 vs 0.762)를 보인 점이 기술적 신뢰도를 높였다. acceptance 안정성은 다양한 양자화 수준에서 유지되어 low-bit 구성에서도 speculative decoding의 이득을 실현했다. 이 점은 특히 양자화된 서빙 환경에서의 활용 가능성을 확장했다.
- 다양한 양자화 산출물(Q8_0, Q6_K, Q5_K_M, Q4_K_M, IQ variants)을 공식 제공해 품질·속도·메모리 요구사항에 맞춰 선택할 수 있도록 한 점이 운영적 차별화 요소다. README는 각 파일의 용도와 상대적 속도·품질 특성을 표로 정리해 실무 선택을 단순화했다. 특히 IQ2_M 같은 초저메모리 옵션은 매우 제한된 리소스에서의 서빙을 가능하게 했다.
- 실험 결과 RTX A6000 환경에서 single-stream decode 처리량이 약 1.4–1.7배 향상된 것으로 보고되어 실제 하드웨어에서 유의미한 처리량 이득을 보였다. 이 향상은 초안 병렬 생성과 검증이 병렬화된 워크플로에서 발생하는 것으로, 대기 시간과 처리량 요구가 높은 서빙 환경에 유리하다. 또한 per-token acceptance 수치가 vLLM 참조에 근접해 검증된 정확성 특성을 유지했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MTP n-max 3 (Q8_0) decode tok/s | decode tok/s | 122.6 | vs base 71.0 (1.73×) |
| MTP n-max 2 (Q8_0) acceptance | acceptance | 0.766 | vLLM reference 0.762 |
| Q4_K_M base vs MTP (n-max 3) | speedup | 1.38× | base Q4_K_M 105.4 -> MTP 145.3 (acceptance 0.659) |
58
LIKES
41.5k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.