TokenRhythm/NeoHorse-1-4B
Qwen3.5-4B에 Routing-guided agentic post-training을 적용해 에이전트·코딩·지시 수행 성능을 높인 4B 모델
학습 방식 · Qwen3.5-4B 기반 Routing-guided agentic post-training으로, routing-guided curriculum SFT와 routing-guided on-policy distillation을 활용해 실행 trajectory와 harness context를 학습 신호로 구성합니다.
TL;DR
NeoHorse-1-4B는 Qwen3.5-4B를 기반으로 TokenRhythm이 Fine-tuning한 약 4B 규모의 causal language model입니다. Routing-guided agentic post-training으로 이기종 모델 풀에 작업을 배정하고, tool interaction과 결과를 기록해 다음 학습 데이터 구성에 반영하는 구조를 겨냥합니다. 텍스트 기반 agent harness, tool use, coding, reasoning, instruction following에 맞춰 조정했으며, 10개 벤치마크 평균 64.87점으로 Qwen3.5-4B의 58.94점보다 5.93점 높습니다. 체크포인트는 language-model weights만 포함한 text-only 재패키징이며, SGLang과 vLLM에서 OpenAI-compatible API로 구동할 수 있습니다.
핵심 포인트
- Qwen3.5-4B를 Fine-tuning해 텍스트 기반 agent harness와 tool use 실행 흐름에 맞춘 모델입니다.
- Routing harness가 작업을 모델 풀에 배정하고 실행 결과와 capability 수요를 다음 학습 혼합물에 반영합니다.
- 10개 벤치마크 평균 64.87점으로 Qwen3.5-4B 대비 5.93점 높은 종합 점수를 기록했습니다.
- 262,144 토큰 컨텍스트와 BF16 Safetensors를 제공하며 SGLang·vLLM 배포 예시가 있습니다.
제한사항
- language-model weights만 포함하므로 vision weights가 없고 텍스트 입력·출력만 지원합니다.
- 실제 처리 가능한 컨텍스트 길이는 GPU 메모리와 serving 설정에 따라 달라지며, README도 필요할 때 context limit을 낮추도록 안내합니다.
- 벤치마크별 실행 횟수와 평가 프로토콜이 다르며, QwenClawBench·WorkBuddy Bench·tau2-Bench는 3회, PinchBench·VitaBench는 1회 실행으로 산출했습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| QwenClawBench | score | 44.68 | 기반 모델 Qwen3.5-4B의 38.47 대비 +6.21 |
| WorkBuddy Bench | score | 34.41 | 기반 모델 Qwen3.5-4B의 24.62 대비 +9.79 |
| PinchBench | score | 77.33 | 기반 모델 Qwen3.5-4B의 71.19 대비 +6.14 |
| VitaBench | score | 32.00 | 기반 모델 Qwen3.5-4B의 21.50 대비 +10.50 |
| BFCL v4 | score | 61.79 | 기반 모델 Qwen3.5-4B의 61.02 대비 +0.77 |
| tau2-Bench | score | 88.46 | 기반 모델 Qwen3.5-4B의 84.29 대비 +4.17 |
| HumanEval | score | 96.95 | 기반 모델 Qwen3.5-4B의 87.20 대비 +9.75 |
| LiveCodeBench v6 | score | 59.43 | 기반 모델 Qwen3.5-4B의 53.71 대비 +5.72 |
| IFBench | score | 65.33 | 기반 모델 Qwen3.5-4B의 60.33 대비 +5.00 |
| IFEval | score | 88.35 | 기반 모델 Qwen3.5-4B의 87.06 대비 +1.29 |
| Ten-benchmark average | macro average | 64.87 | 기반 모델 Qwen3.5-4B의 58.94 대비 +5.93 |
이미지 분석

810
LIKES
5.3k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.