empero-ai/Qwen3.8-9B
텍스트 생성과 추론, 수학·코드 문제 해결, 지시 이행, Function Calling을 수행하는 Causal Language Model입니다.9B262K 컨텍스트apache-2.0
Qwen3.8 2.4T A95B의 추론 궤적을 Qwen3.5-9B에 증류한 9B 텍스트 생성 모델
학습 방식 · Qwen3.5-9B를 기반으로 Qwen3.8 2.4T A95B의 수학·코드·추론·도구 사용 교사 궤적 약 70,000개를 사용해 모든 파라미터를 SFT 방식으로 학습한 Off-policy distillation입니다.
TL;DR
Qwen3.8-9B는 Qwen3.5-9B를 기반으로 Qwen3.8 2.4T A95B의 교사 궤적 약 70,000개를 학습한 9B급 Full-parameter distillation 모델입니다. 모든 파라미터를 SFT로 업데이트하고 수학·코드·일반 추론·도구 사용 데이터를 주입해 답변 앞에 <think> 블록을 생성하도록 구성했습니다. MMLU CoT 정확도는 flexible-extract 0.751로 기반 모델의 0.546보다 0.205 높았지만, GSM8K flexible exact_match는 0.870으로 기반 모델의 0.885보다 낮았습니다. 262,144-token Native Context와 Qwen3.5 규격의 Function Calling을 제공해 단일 GPU 배포를 겨냥하지만, Qwen3.5 지원 Transformers와 Gated DeltaNet용 CUDA 커널이 필요합니다.
핵심 포인트
- Qwen3.5-9B의 모든 파라미터를 업데이트한 Full-parameter distillation 모델입니다.
- Qwen3.8 2.4T A95B의 검수된 교사 추론 궤적 약 70,000개를 SFT에 활용했습니다.
- 수학과 Competitive Programming에 가중치를 둔 <think> 기반 추론 출력을 생성합니다.
- Qwen3.5 사양의 Native Function Calling과 262,144-token Context를 지원합니다.
제한사항
- GSM8K CoT 점수는 Qwen3.5-9B의 0.885에서 0.870으로 낮아졌고, strict exact_match도 0.875에서 0.850으로 하락했습니다.
- 긴 생성에서는 Greedy decoding이 반복 루프를 일으킬 수 있으며, 쉬운 질문에도 교사 추론 스타일에 따른 과도하게 긴 숙고가 발생할 수 있습니다.
- Fine-tune은 텍스트 경로에만 적용됐고 Vision 동작은 Qwen3.5-9B에서 상속됐지만 이 모델에서는 평가되지 않았습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| gsm8k_cot | exact_match (flexible) | 0.870 | 기반 모델 Qwen3.5-9B의 0.885 대비 −0.015 |
| gsm8k_cot | exact_match (strict) | 0.850 | 기반 모델 Qwen3.5-9B의 0.875 대비 −0.025 |
| mmlu (CoT, 57 subjects) | acc (flexible-extract) | 0.751 | 기반 모델 Qwen3.5-9B의 0.546 대비 +0.205 |
| mmlu (CoT, 57 subjects) | acc (strict-match) | 0.511 | 기반 모델 Qwen3.5-9B의 0.251 대비 +0.260 |
109
Likes
540
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.