본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

TokenRhythm/NeoHorse-1-4B

텍스트 생성, tool use, coding, reasoning, instruction following을 지원하는 causal language model약 4B기본 262,144 토큰, 최대 1,010,000 토큰까지 확장 가능 컨텍스트apache-2.0

Qwen3.5-4B에 Routing-guided agentic post-training을 적용해 에이전트·코딩·지시 수행 성능을 높인 4B 모델

학습 방식 · Qwen3.5-4B 기반 Routing-guided agentic post-training으로, routing-guided curriculum SFT와 routing-guided on-policy distillation을 활용해 실행 trajectory와 harness context를 학습 신호로 구성합니다.

TL;DR

NeoHorse-1-4B는 Qwen3.5-4B를 기반으로 TokenRhythm이 Fine-tuning한 약 4B 규모의 causal language model입니다. Routing-guided agentic post-training으로 이기종 모델 풀에 작업을 배정하고, tool interaction과 결과를 기록해 다음 학습 데이터 구성에 반영하는 구조를 겨냥합니다. 텍스트 기반 agent harness, tool use, coding, reasoning, instruction following에 맞춰 조정했으며, 10개 벤치마크 평균 64.87점으로 Qwen3.5-4B의 58.94점보다 5.93점 높습니다. 체크포인트는 language-model weights만 포함한 text-only 재패키징이며, SGLang과 vLLM에서 OpenAI-compatible API로 구동할 수 있습니다.

핵심 포인트

  • Qwen3.5-4B를 Fine-tuning해 텍스트 기반 agent harness와 tool use 실행 흐름에 맞춘 모델입니다.
  • Routing harness가 작업을 모델 풀에 배정하고 실행 결과와 capability 수요를 다음 학습 혼합물에 반영합니다.
  • 10개 벤치마크 평균 64.87점으로 Qwen3.5-4B 대비 5.93점 높은 종합 점수를 기록했습니다.
  • 262,144 토큰 컨텍스트와 BF16 Safetensors를 제공하며 SGLang·vLLM 배포 예시가 있습니다.

제한사항

  • language-model weights만 포함하므로 vision weights가 없고 텍스트 입력·출력만 지원합니다.
  • 실제 처리 가능한 컨텍스트 길이는 GPU 메모리와 serving 설정에 따라 달라지며, README도 필요할 때 context limit을 낮추도록 안내합니다.
  • 벤치마크별 실행 횟수와 평가 프로토콜이 다르며, QwenClawBench·WorkBuddy Bench·tau2-Bench는 3회, PinchBench·VitaBench는 1회 실행으로 산출했습니다.

벤치마크

벤치마크지표비교
QwenClawBenchscore44.68기반 모델 Qwen3.5-4B의 38.47 대비 +6.21
WorkBuddy Benchscore34.41기반 모델 Qwen3.5-4B의 24.62 대비 +9.79
PinchBenchscore77.33기반 모델 Qwen3.5-4B의 71.19 대비 +6.14
VitaBenchscore32.00기반 모델 Qwen3.5-4B의 21.50 대비 +10.50
BFCL v4score61.79기반 모델 Qwen3.5-4B의 61.02 대비 +0.77
tau2-Benchscore88.46기반 모델 Qwen3.5-4B의 84.29 대비 +4.17
HumanEvalscore96.95기반 모델 Qwen3.5-4B의 87.20 대비 +9.75
LiveCodeBench v6score59.43기반 모델 Qwen3.5-4B의 53.71 대비 +5.72
IFBenchscore65.33기반 모델 Qwen3.5-4B의 60.33 대비 +5.00
IFEvalscore88.35기반 모델 Qwen3.5-4B의 87.06 대비 +1.29
Ten-benchmark averagemacro average64.87기반 모델 Qwen3.5-4B의 58.94 대비 +5.93

이미지 분석

NeoHorse-1-4B와 다섯 개 비교 모델의 Agentic, Coding, Instruction Following 및 10개 벤치마크 평균 점수를 막대그래프로 비교한 이미지입니다.
상단 Agentic 영역에서 NeoHorse-1-4B는 QwenClawBench 44.7, WorkBuddy 34.4, PinchBench 77.3, VitaBench 32.0, BFCL v4 61.8, τ²-Bench 88.5를 기록합니다. 하단에서는 HumanEval 97.0, LiveCodeBench v6 59.4, IFBench 65.3, IFEval 88.4와 10개 벤치마크 평균 64.87이 표시되어, 에이전트·코딩·지시 수행 전반의 점수를 한 화면에서 비교하게 합니다.

810

LIKES

5.3k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.