본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

empero-ai/Qwen3.8-9B

텍스트 생성과 추론, 수학·코드 문제 해결, 지시 이행, Function Calling을 수행하는 Causal Language Model입니다.9B262K 컨텍스트apache-2.0

Qwen3.8 2.4T A95B의 추론 궤적을 Qwen3.5-9B에 증류한 9B 텍스트 생성 모델

학습 방식 · Qwen3.5-9B를 기반으로 Qwen3.8 2.4T A95B의 수학·코드·추론·도구 사용 교사 궤적 약 70,000개를 사용해 모든 파라미터를 SFT 방식으로 학습한 Off-policy distillation입니다.

TL;DR

Qwen3.8-9B는 Qwen3.5-9B를 기반으로 Qwen3.8 2.4T A95B의 교사 궤적 약 70,000개를 학습한 9B급 Full-parameter distillation 모델입니다. 모든 파라미터를 SFT로 업데이트하고 수학·코드·일반 추론·도구 사용 데이터를 주입해 답변 앞에 <think> 블록을 생성하도록 구성했습니다. MMLU CoT 정확도는 flexible-extract 0.751로 기반 모델의 0.546보다 0.205 높았지만, GSM8K flexible exact_match는 0.870으로 기반 모델의 0.885보다 낮았습니다. 262,144-token Native Context와 Qwen3.5 규격의 Function Calling을 제공해 단일 GPU 배포를 겨냥하지만, Qwen3.5 지원 Transformers와 Gated DeltaNet용 CUDA 커널이 필요합니다.

핵심 포인트

  • Qwen3.5-9B의 모든 파라미터를 업데이트한 Full-parameter distillation 모델입니다.
  • Qwen3.8 2.4T A95B의 검수된 교사 추론 궤적 약 70,000개를 SFT에 활용했습니다.
  • 수학과 Competitive Programming에 가중치를 둔 <think> 기반 추론 출력을 생성합니다.
  • Qwen3.5 사양의 Native Function Calling과 262,144-token Context를 지원합니다.

제한사항

  • GSM8K CoT 점수는 Qwen3.5-9B의 0.885에서 0.870으로 낮아졌고, strict exact_match도 0.875에서 0.850으로 하락했습니다.
  • 긴 생성에서는 Greedy decoding이 반복 루프를 일으킬 수 있으며, 쉬운 질문에도 교사 추론 스타일에 따른 과도하게 긴 숙고가 발생할 수 있습니다.
  • Fine-tune은 텍스트 경로에만 적용됐고 Vision 동작은 Qwen3.5-9B에서 상속됐지만 이 모델에서는 평가되지 않았습니다.

벤치마크

벤치마크지표비교
gsm8k_cotexact_match (flexible)0.870기반 모델 Qwen3.5-9B의 0.885 대비 −0.015
gsm8k_cotexact_match (strict)0.850기반 모델 Qwen3.5-9B의 0.875 대비 −0.025
mmlu (CoT, 57 subjects)acc (flexible-extract)0.751기반 모델 Qwen3.5-9B의 0.546 대비 +0.205
mmlu (CoT, 57 subjects)acc (strict-match)0.511기반 모델 Qwen3.5-9B의 0.251 대비 +0.260

109

Likes

540

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.