empero-ai/Qwen3.8-9B-Distill
Qwen3.8 2.4T A95B의 추론 궤적을 Qwen3.5-9B 구조에 증류한 텍스트 생성 및 추론 모델9B262K 컨텍스트apache-2.0
Qwen3.8 2.4T A95B의 추론 궤적을 Qwen3.5-9B에 증류한 9B 모델
학습 방식 · Qwen/Qwen3.5-9B 기반 full-parameter SFT(off-policy distillation)로 Qwen3.8 2.4T A95B의 품질 필터링된 교사 궤적 약 70,000개를 학습했습니다.
TL;DR
Qwen3.8-9B는 Qwen/Qwen3.5-9B를 기반으로 Qwen3.8 2.4T A95B의 교사 궤적 약 7만 개를 학습한 9B full-parameter distillation 모델입니다. 수학·코드·일반 추론·도구 사용 trace를 SFT로 주입하고 각 응답을 `<think>` 블록으로 시작하게 만들어, 단일 GPU 배포를 겨냥한 추론 동작을 구현했습니다. MMLU CoT 정확도는 flexible 기준 0.751로 base의 0.546보다 0.205 높았지만 GSM8K flexible 기준은 0.870으로 base의 0.885보다 낮았습니다. 262,144-token context와 native function calling을 지원하며, 긴 생성에서는 권장 sampling과 Gated DeltaNet 커널 구성이 필요합니다.
핵심 포인트
- Qwen3.8 2.4T A95B의 교사 궤적 약 7만 개로 학습한 full-parameter distillation 모델입니다. 전체 가중치를 갱신해 adapter 없이 추론 패턴을 9B 구조에 반영했습니다. 수학·코드·일반 추론·도구 사용 데이터에 집중했습니다.
- 각 답변은 교사 모델의 추론을 학습한 `<think>` 블록으로 시작합니다. 자체 생성 rollout이 아니라 품질 필터를 거친 teacher trace를 SFT에 사용했습니다. 따라서 복잡한 문제에서는 긴 사고 과정을 활용하지만 쉬운 질문에도 숙고가 길어질 수 있습니다.
- Qwen3.5 사양에 따른 native function calling을 지원합니다. 별도 wrapper나 tool 전용 Fine-tuning 없이 표준 도구 호출 흐름을 사용할 수 있습니다. 262,144-token native context도 Qwen3.5-9B 기반에서 이어받았습니다.
- Qwen3.5 지원이 포함된 최신 `transformers`와 Gated DeltaNet 커널이 필요합니다. `flash-linear-attention`과 CUDA에 맞는 `causal_conv1d`가 없으면 linear-attention 층이 느리고 메모리를 많이 쓰는 PyTorch 연산으로 대체됩니다. 긴 추론에서는 `temperature=0.6`, `top_p=0.95`, `top_k=20` 설정이 권장됩니다.
제한사항
- GSM8K에서는 base보다 점수가 낮았습니다. flexible exact match는 0.885에서 0.870으로, strict exact match는 0.875에서 0.850으로 감소했습니다. 수학 문제 전반의 우위보다 MMLU와 일반 추론 개선에 강점이 집중됩니다.
- 긴 생성에서 greedy decoding을 사용하면 반복 루프가 발생할 수 있습니다. 권장 sampling 설정과 최대 16,384개의 새 토큰을 사용하고, 최종 사용자에게는 `<think>...</think>` 구간을 제거해야 합니다. 교사 추론 스타일을 그대로 이어받아 쉬운 질문에도 과도하게 긴 숙고가 나올 수 있습니다.
- Fine-tune은 text-only로 수행됐습니다. vision behavior는 Qwen3.5-9B base에서 상속됐지만 이 모델 README에서는 평가되지 않았습니다. 따라서 이미지 입력 성능을 이 모델의 distillation 결과로 판단할 근거가 없습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| gsm8k_cot | exact_match (flexible) | 0.870 | 동일 조건의 Qwen3.5-9B base 0.885 대비 −0.015 |
| gsm8k_cot | exact_match (strict) | 0.850 | 동일 조건의 Qwen3.5-9B base 0.875 대비 −0.025 |
| mmlu (CoT, 57 subjects) | acc (flexible-extract) | 0.751 | 동일 조건의 Qwen3.5-9B base 0.546 대비 +0.205 |
| mmlu (CoT, 57 subjects) | acc (strict-match) | 0.511 | 동일 조건의 Qwen3.5-9B base 0.251 대비 +0.260 |
140
Likes
4.4k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.