XHToken/Spark-X2.5-4B
대화, Writing, Translation, Reasoning, Coding, Tool Use 및 Agent Workflow를 위한 Text Generation4B1K 컨텍스트apache-2.0
Hybrid Attention으로 1M 토큰과 Agent·Coding 작업을 겨냥한 4B post-trained 모델
학습 방식 · XHToken/Spark-X2.5-4B-Base에 약 20조 토큰 사전 학습, 수천억 토큰 규모의 1M 토큰 장문 학습, SFT, 영역별 대규모 Reinforcement Learning, MOPD를 순차 적용했습니다.
TL;DR
XHToken/Spark-X2.5-4B는 XHToken/Spark-X2.5-4B-Base를 기반으로 SFT, 대규모 Reinforcement Learning, MOPD를 적용한 post-trained text-generation 모델입니다. 전체 Attention 1개와 Sliding Window Attention 3개를 결합해 긴 입력에서 Attention 계산량과 KV-cache 부담을 줄이면서 최대 1M 토큰 Context를 지원합니다. 약 20조 토큰 사전 학습과 최대 1M 토큰 시퀀스를 사용한 장문 학습 뒤 언어 이해, 추론, Programming, Tool-augmented Agent 행동을 대상으로 후속 학습을 진행했습니다. 4B급 비교에서 SWE-Bench Pro 44.4, AIME 2026 90.7, τ³-bench 30.4를 기록해 Coding·수학·Agent 작업 중심의 로컬 배포 후보로 적합합니다.
핵심 포인트
- 전체 Attention 1개와 Sliding Window Attention 3개를 교차 배치해 긴 입력의 계산량과 KV-cache 사용량을 함께 줄입니다.
- 약 20조 토큰 사전 학습 뒤 1M 토큰 장문 학습과 SFT·Reinforcement Learning·MOPD를 순차 적용합니다.
- SWE-Bench Pro 44.4와 SWE-Bench Multilingual 53.3으로 4B급 Coding·다국어 코드 작업 성능을 측정했습니다.
- SGLang·vLLM·MLX·Ollama·LM Studio와 NVIDIA·Huawei Ascend 등 여러 실행 환경을 지원합니다.
제한사항
- 1,048,576 토큰 Context 설정은 충분한 device memory가 필요하며, 메모리가 부족하면 context length를 낮춰야 합니다.
- vLLM 배포에는 remote code 신뢰 설정과 Spark plugin 설치가 필요하고, SGLang은 Spark-X2.5 전용 runtime 이미지 사용이 안내되어 있습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| τ³-bench | score | 30.4 | 표에 수록된 비교 모델 중 Qwen3.5-9B 9.3, Qwen3.5-4B 6.7, Gemma4-12B 13.3보다 높음 |
| SWE-Bench Pro | score | 44.4 | Qwen3.5-9B 33.8, Qwen3.5-4B 29.4, Gemma4-12B 21.9보다 높음 |
| AIME 2026 | score | 90.7 | Qwen3.5-9B 88.2, Qwen3.5-4B 83.0, Gemma4-12B 82.1보다 높음 |
| IFBench | score | 75.0 | Qwen3.5-9B 64.5, Qwen3.5-4B 59.2, Gemma4-12B 73.5보다 높음 |
이미지 분석

115
LIKES
429
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.