본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

IFM/K2-Horizon-MoVA-36B-A4B-GGUF

영어 텍스트 생성, reasoning, tool call 및 agentic 작업36B 전체, 4B 활성524K 컨텍스트apache-2.0

36B MoE 모델의 BF16 GGUF 배포본으로 4B 활성 추론과 512K context를 지원

학습 방식 · IFM/K2-Horizon-Pretrain-Data와 IFM/K2-Horizon-Midtrain-Data를 사용한 K2-Horizon-MoVA-36B-A4B 기반 학습이며, 중간 checkpoint·학습 데이터·training code 공개가 예정되어 있습니다.

TL;DR

이 모델은 IFM/K2-Horizon-MoVA-36B-A4B를 llama.cpp용 GGUF 형식으로 제공하는 배포본이며, 별도 양자화 수치가 아니라 원본 BF16 tensor를 유지합니다. 기반 모델은 36B 파라미터 Mixture-of-Experts 구조로 token마다 4B 파라미터를 활성화하고, Mixture-of-Values attention인 MoVA를 사용합니다. 네이티브 524,288-token context와 reasoning·tool call 처리를 지원하며, vLLM·SGLang·Transformers 연동 방법이 함께 제공됩니다. Agentic tool use와 terminal coding에서 강점을 보이지만, GGUF 실행에는 K2 Horizon architecture를 지원하는 llama.cpp 버전이 필요합니다.

핵심 포인트

  • 36B 전체 중 token마다 4B만 활성화하는 MoE 구조와 MoVA attention으로 모델 규모와 실행 비용 사이의 균형을 맞춥니다.
  • 원본 BF16 tensor와 tokenizer·llama.cpp chat template을 GGUF에 담아 llama.cpp 기반 실행 환경에 연결합니다.
  • tau3-Banking 26.8, Terminal-Bench 2.1 58.6으로 agentic 작업과 terminal 사용 평가에서 비교 모델보다 높은 점수를 기록했습니다.
  • 네이티브 524,288-token context를 제공하며 reasoning effort를 high로 설정할 때 보고된 벤치마크 조건과 일치합니다.

제한사항

  • GGUF 파일을 실행하려면 K2 Horizon architecture 지원이 포함된 llama.cpp 버전이 필요하며, README 기준 관련 PR이 진행 중입니다.
  • 공개 벤치마크 수치는 Artificial Analysis 기준이며, Muse Glimmer-30B는 high reasoning effort, 나머지 open model은 reasoning mode에서 측정됐습니다.
  • 제공된 실행 예시는 vLLM·SGLang에서 TP=2 및 expert parallel 설정을 사용하므로 단일 장치 실행 조건의 성능과는 다를 수 있습니다.

벤치마크

벤치마크지표비교
tau3-Bankingscore (%)26.8표의 open-weight 비교 모델 중 최고 점수; G9v3-39A5B 22.1, Muse Glimmer-30B 23.5
Terminal-Bench 2.1score (%)58.6표의 open-weight 비교 모델 중 최고 점수; Nemotron 3 Ultra 53.9, Muse Glimmer-30B 51.7
SciCodescore (%)38.9Muse Glimmer-30B 43.6, Gemma 4 31B-it 43.4보다 낮고 Nemotron 3 Ultra 39.9에 근접
Humanity's Last Exam (without tools)score (%)25.2Nemotron 3 Ultra 28.4보다 낮고 Gemma 4 31B-it 23.6보다 높음
GPQA Diamondscore (%)80.8Nemotron 3 Ultra 86.7, Gemma 4 31B-it 85.7, Muse Glimmer-30B 83.5보다 낮음
CritPtscore (%)2.1Nemotron 3 Ultra와 Nemotron 3 Super 3.1보다 낮고 Muse Glimmer-30B 2.6보다 낮음
AA-LCRscore (%)66.3Muse Glimmer-30B 80.0, Nemotron 3 Ultra 71.0, Gemma 4 31B-it 68.3보다 낮음
AA-Omniscience Accuracyscore (%)18.8Muse Glimmer-30B 27.0, Nemotron 3 Super 24.3, Nemotron 3 Ultra 22.6보다 낮음
AA-Omniscience Non-Hallucinationscore (%)69.2G9v3-39A5B 87.0보다 낮고 Nemotron 3 Ultra 70.3에 근접

이미지 분석

K2-Horizon-MoVA-36B-A4B와 open-weight·closed 모델의 6개 벤치마크 점수를 비교한 막대 차트입니다.
차트는 K2-Horizon-MoVA-36B-A4B가 4B 활성 파라미터로 tau3-Banking 26.8, Terminal-Bench 2.1 58.6에서 비교군을 앞서며, SciCode 38.9와 Humanity's Last Exam 25.2에서는 중상위권에 위치함을 나타냅니다. AA-LCR 66.3, CritPt 2.1에서는 일부 대형 모델보다 낮아 agentic 작업과 terminal 사용에 상대적으로 강하고 과학·장문 추론 전반에서 우위가 균일하지 않은 성능 패턴을 확인할 수 있습니다.

68

LIKES

1.3k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.