IFM/K2-Horizon-MoVA-36B-A4B-GGUF
영어 텍스트 생성, reasoning, tool call 및 agentic 작업36B 전체, 4B 활성524K 컨텍스트apache-2.0
36B MoE 모델의 BF16 GGUF 배포본으로 4B 활성 추론과 512K context를 지원
학습 방식 · IFM/K2-Horizon-Pretrain-Data와 IFM/K2-Horizon-Midtrain-Data를 사용한 K2-Horizon-MoVA-36B-A4B 기반 학습이며, 중간 checkpoint·학습 데이터·training code 공개가 예정되어 있습니다.
TL;DR
이 모델은 IFM/K2-Horizon-MoVA-36B-A4B를 llama.cpp용 GGUF 형식으로 제공하는 배포본이며, 별도 양자화 수치가 아니라 원본 BF16 tensor를 유지합니다. 기반 모델은 36B 파라미터 Mixture-of-Experts 구조로 token마다 4B 파라미터를 활성화하고, Mixture-of-Values attention인 MoVA를 사용합니다. 네이티브 524,288-token context와 reasoning·tool call 처리를 지원하며, vLLM·SGLang·Transformers 연동 방법이 함께 제공됩니다. Agentic tool use와 terminal coding에서 강점을 보이지만, GGUF 실행에는 K2 Horizon architecture를 지원하는 llama.cpp 버전이 필요합니다.
핵심 포인트
- 36B 전체 중 token마다 4B만 활성화하는 MoE 구조와 MoVA attention으로 모델 규모와 실행 비용 사이의 균형을 맞춥니다.
- 원본 BF16 tensor와 tokenizer·llama.cpp chat template을 GGUF에 담아 llama.cpp 기반 실행 환경에 연결합니다.
- tau3-Banking 26.8, Terminal-Bench 2.1 58.6으로 agentic 작업과 terminal 사용 평가에서 비교 모델보다 높은 점수를 기록했습니다.
- 네이티브 524,288-token context를 제공하며 reasoning effort를 high로 설정할 때 보고된 벤치마크 조건과 일치합니다.
제한사항
- GGUF 파일을 실행하려면 K2 Horizon architecture 지원이 포함된 llama.cpp 버전이 필요하며, README 기준 관련 PR이 진행 중입니다.
- 공개 벤치마크 수치는 Artificial Analysis 기준이며, Muse Glimmer-30B는 high reasoning effort, 나머지 open model은 reasoning mode에서 측정됐습니다.
- 제공된 실행 예시는 vLLM·SGLang에서 TP=2 및 expert parallel 설정을 사용하므로 단일 장치 실행 조건의 성능과는 다를 수 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| tau3-Banking | score (%) | 26.8 | 표의 open-weight 비교 모델 중 최고 점수; G9v3-39A5B 22.1, Muse Glimmer-30B 23.5 |
| Terminal-Bench 2.1 | score (%) | 58.6 | 표의 open-weight 비교 모델 중 최고 점수; Nemotron 3 Ultra 53.9, Muse Glimmer-30B 51.7 |
| SciCode | score (%) | 38.9 | Muse Glimmer-30B 43.6, Gemma 4 31B-it 43.4보다 낮고 Nemotron 3 Ultra 39.9에 근접 |
| Humanity's Last Exam (without tools) | score (%) | 25.2 | Nemotron 3 Ultra 28.4보다 낮고 Gemma 4 31B-it 23.6보다 높음 |
| GPQA Diamond | score (%) | 80.8 | Nemotron 3 Ultra 86.7, Gemma 4 31B-it 85.7, Muse Glimmer-30B 83.5보다 낮음 |
| CritPt | score (%) | 2.1 | Nemotron 3 Ultra와 Nemotron 3 Super 3.1보다 낮고 Muse Glimmer-30B 2.6보다 낮음 |
| AA-LCR | score (%) | 66.3 | Muse Glimmer-30B 80.0, Nemotron 3 Ultra 71.0, Gemma 4 31B-it 68.3보다 낮음 |
| AA-Omniscience Accuracy | score (%) | 18.8 | Muse Glimmer-30B 27.0, Nemotron 3 Super 24.3, Nemotron 3 Ultra 22.6보다 낮음 |
| AA-Omniscience Non-Hallucination | score (%) | 69.2 | G9v3-39A5B 87.0보다 낮고 Nemotron 3 Ultra 70.3에 근접 |
이미지 분석

68
LIKES
1.3k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.