본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

protoLabsAI/Ornith-1.0-9B-MTP-GGUF

주요 수행 과제는 text-generation으로, 단일 스트림 텍스트 생성의 처리량을 높이는 데 초점이 맞춰져 있다. 모델 번들은 초안(draft) 생성과 병렬 검증을 결합한 speculative decoding 워크플로를 지원하며 greedy/temp 0과 호환되는 출력을 생성한다. 또한 다양한 양자화 포맷을 제공해 VRAM 제한 환경에서도 텍스트 생성 서비스 운영이 가능하도록 설계되었다.9Bmit

Ornith-1.0-9B MTP GGUF는 MTP nextn 헤드를 트렁크에 통합해 llama.cpp에서 분포 무손실 multi-token speculative decoding을 제공하며 RTX A6000에서 최대 1.73× 추론 속도 향상을 보였다.

학습 방식 · 본 배포는 deepreinforce-ai의 Ornith-1.0-9B 트렁크에 protoLabsAI의 KL-distilled MTP draft head를 graft한 형태로 제작되었다. KL-distillation은 초안 분포를 트렁크 분포에 정렬시키는 방식으로 헤드를 학습하는 데 사용되었으며 초안의 수용률을 높이는 데 기여했다. 헤드는 트렁크에 15개의 텐서를 추가하는 방식으로 통합되어 번들형 GGUF 또는 분리형 draft 파일로 배포될 수 있다.

TL;DR

이 배포는 deepreinforce-ai의 Ornith-1.0-9B 트렁크에 protoLabsAI의 KL-distilled MTP nextn 헤드를 graft해 GGUF 번들과 분리형 draft 헤드를 모두 제공하는 형태로, llama.cpp에서 분포 무손실의 multi-token speculative decoding을 기본 지원한다. 벤치마크는 RTX A6000 환경에서 n-max 3 구성 기준으로 Q8_0에서 122.6 decode tok/s와 1.73×의 처리량 향상을 보고했으며 per-token acceptance 수치가 vLLM 레퍼런스와 근접함이 확인되었다. 다양한 양자화 산출물이 제공되어 VRAM 제약에 따른 트레이드오프를 조절할 수 있고 IQ2_M 등 초저메모리 옵션은 약 5GB 수준의 서빙을 가능하게 했다. 다만 llama.cpp 최소 버전 요구(b9616)와 graft→convert 순서를 지키지 않으면 텐서 불일치 오류가 발생할 수 있어 배포 전 변환 절차를 엄격히 따라야 한다.

핵심 포인트

  • 트렁크에 KL-distilled MTP nextn 헤드를 graft한 번들형 GGUF를 제공해 llama.cpp에서 별도 드래프트 모델 없이도 lossless multi-token speculative decoding을 즉시 실행할 수 있게 한 배포 방식이 차별점이다. 이 접근은 번들형과 분리형 두 가지 배포 경로를 모두 지원해 배포 유연성을 높였다. 결과적으로 사용자 환경에 따라 번들 파일을 선택하거나 헤드만 추가해 운용할 수 있다.
  • 벤치마크에서 보고된 per-token acceptance가 vLLM 레퍼런스와 근접한 수치(0.766 vs 0.762)를 보인 점이 기술적 신뢰도를 높였다. acceptance 안정성은 다양한 양자화 수준에서 유지되어 low-bit 구성에서도 speculative decoding의 이득을 실현했다. 이 점은 특히 양자화된 서빙 환경에서의 활용 가능성을 확장했다.
  • 다양한 양자화 산출물(Q8_0, Q6_K, Q5_K_M, Q4_K_M, IQ variants)을 공식 제공해 품질·속도·메모리 요구사항에 맞춰 선택할 수 있도록 한 점이 운영적 차별화 요소다. README는 각 파일의 용도와 상대적 속도·품질 특성을 표로 정리해 실무 선택을 단순화했다. 특히 IQ2_M 같은 초저메모리 옵션은 매우 제한된 리소스에서의 서빙을 가능하게 했다.
  • 실험 결과 RTX A6000 환경에서 single-stream decode 처리량이 약 1.4–1.7배 향상된 것으로 보고되어 실제 하드웨어에서 유의미한 처리량 이득을 보였다. 이 향상은 초안 병렬 생성과 검증이 병렬화된 워크플로에서 발생하는 것으로, 대기 시간과 처리량 요구가 높은 서빙 환경에 유리하다. 또한 per-token acceptance 수치가 vLLM 참조에 근접해 검증된 정확성 특성을 유지했다.

벤치마크

벤치마크지표비교
MTP n-max 3 (Q8_0) decode tok/sdecode tok/s122.6vs base 71.0 (1.73×)
MTP n-max 2 (Q8_0) acceptanceacceptance0.766vLLM reference 0.762
Q4_K_M base vs MTP (n-max 3)speedup1.38×base Q4_K_M 105.4 -> MTP 145.3 (acceptance 0.659)

58

LIKES

41.5k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.