Qwen 3.6 35B를 Fable 스타일 추론·코드 중심으로 파인튜닝한 풀 체크포인트
unsloth/Qwen3.6-35b을 기반으로 Fable 5 스타일의 정제된 추론·instruction 데이터로 풀 체크포인트 Fine-tuning을 진행해 코드 생성·기술적 추론·단계적 응답을 강화한 모델이다.
TL;DR
Qwable 3.6 35b는 unsloth/Qwen3.6-35b를 기반으로 정제된 Fable 5 스타일의 reasoning·instruction 예시로 풀 체크포인트 방식으로 파인튜닝한 모델이다. 본 체크포인트는 LoRA가 아닌 전체 가중치를 포함하며 MTP 레이어가 0으로 설정되어 있어 변환·로컬 추론을 염두에 둔 배포 형태를 갖춘다. 파인튜닝은 instruction-tuning과 trace-style 예시를 결합해 출력이 단계적이고 구조화된 어시스턴트 성향을 띠도록 유도했다. 모델 클래스는 Qwen3_5ForConditionalGeneration이며 README에는 Transformers에서 trust_remote_code=True로 로드하는 코드와 GGUF 변환·검증 권장 절차, 권장 생성 하이퍼파라미터가 포함되어 있다. 그 결과 코드 생성·편집, 기술적 디버깅, 추론 중심의 단계적 응답에서 스타일적·응답 품질상의 차이를 기대할 수 있으나, 본 체크포인트는 생산 환경용 검증을 거치지 않았고 기반 모델의 한계·데이터 편향을 물려받을 수 있다. GGUF 변환 후 결과 검증과 고위험 사용처에 대한 별도 평가가 필요하다.
핵심 역량
- 구조화된 단계별(트레이스 스타일) 답변을 생성해 복잡한 기술·논리적 문제를 단계별로 정리한다
- 코드 생성·편집·디버깅 조언을 제공하며 코드 중심 프롬프트에서 보다 안내적인 응답을 출력한다
- instruction-tuning으로 지시 이행 일관성이 개선되어 명령형 입력에 대한 응답 결과가 더 예측 가능하다
- 풀 체크포인트 형태로 Transformers에서 직접 사용하거나 GGUF로 변환해 로컬 러ntime에서 실행할 수 있다
강점
- 풀 체크포인트로 제공되어 LoRA/PEFT 없이 Transformers에서 직접 로드하거나 GGUF로 변환해 로컬에서 단독 실행할 수 있다(README 명시)
- Fable 5 스타일의 정제된 추론·trace examples로 instruction-tuning을 진행해 코드·기술적 추론 응답에서 보다 구조화된 출력 성향을 기대할 수 있다
- MIT 라이선스를 명시하여 재배포·로컬 실험에 제약이 적다
훈련 방식
unsloth/Qwen3.6-35b 기반으로 정제된 Fable 5 스타일의 reasoning·instruction 예시로 instruction tuning(트레이스·추론 스타일)을 수행한 풀 체크포인트 파인튜닝이다.
알아두면 좋은 것
- Base: unsloth/Qwen3.6-35b 기반으로 풀 Hugging Face 체크포인트 형태로 fine-tuning됨
- Training style: instruction tuning + trace/reasoning-style examples, dataset은 정제된 Fable 5 스타일
- 체크포인트는 MTP 레이어가 0으로 명시되어 있어 MTP 의존 런타임 없이 변환·검증 가능
- 로컬 사용성을 고려해 GGUF 변환을 권장하며 변환 후 검증용 샘플 프롬프트를 제시함
기술적 특징
- Instruction + trace-style fine-tuning을 적용해 출력이 단계적·설명적(trace-like)인 응답으로 편향되도록 학습시켰다. 이로 인해 코드와 기술적 추론 프롬프트에서 더 체계적이고 안내적인 답변이 나오도록 설계되었다.
- 체크포인트는 'full HF model checkpoint'로 배포되어 trust_remote_code=True 설정으로 Transformers에서 Qwen3_5ForConditionalGeneration 클래스 사용해 직접 로드한다. 전체 가중치가 포함되어 있어 변환·검증 과정이 단순하다.
- MTP 관련 레이어가 0으로 명시되어 MTP 의존 메타데이터가 없는 상태이므로, MTP를 기대하는 런타임에서는 MTP 관련 가정을 비활성화하거나 no-MTP 설정을 사용해야 한다는 호환성 고려사항이 존재한다.
- 로컬 실행 친화성을 고려해 GGUF 변환을 권장하며, 변환 전후에 텍스트 생성 검증(제공된 샘플 프롬프트 사용)을 권장한다. README에 권장 생성 하이퍼파라미터(temperature, top_p, max_new_tokens 등)가 포함되어 있어 실험 시작점으로 활용 가능하다.
차별점
- 풀(Full) Hugging Face 체크포인트로 배포 — LoRA가 아닌 전체 가중치 포함
- Fable 5 스타일의 정제된 trace/reasoning 예시로 instruction-tuning을 수행해 단계적·설명적 응답 성향을 강화
- MTP 레이어가 0으로 설정되어 MTP 비의존적 변환·로컬 실행에 적합
- 로컬 변환(GGUF) 친화성 및 변환 검증 가이드 제공
64
Likes
7.1k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.