Qwen3.5 9B에 Claude 4.6 사고 패턴을 증류한 고사고력 멀티모달 파인튜닝 모델
Qwen3.5-9B를 기반으로 Claude 4.6의 대규모 distill 데이터로 로컬에서 파인튜닝한 멀티모달(image-text-to-text) 모델로서 사고력(’thinking’) 성능과 시각 입력 처리 능력을 개선한 모델이다.
TL;DR
이 모델은 trohrbaugh의 Qwen3.5-9B-heretic-v2를 기반으로 Unsloth를 이용해 Claude 4.6으로부터 생성된 대규모 distill 데이터로 로컬 파인튜닝한 멀티모달(image-text-to-text) 파인튜닝 모델이다. 파인튜닝 목적은 Claude 4.6의 'thinking' 스타일을 이식해 사고력 관련 생성과 벤치마크 성능을 향상시키는 것이며 README의 벤치마크 표와 Performance 수치(KL divergence 0.0793, Refusals 6/100)가 이러한 변화의 정량적 근거를 제공한다. 아키텍처적으로는 Qwen3.5의 Gated DeltaNet과 sparse Mixture-of-Experts 조합, 네이티브 262,144 토큰의 롱 컨텍스트 지원이 결합되어 멀티모달 이해와 장문 생성에서 실용적 이점을 제공한다. 단점으로는 'HERETIC'·'uncensored'라는 동작 특성 표기에 따라 거부율이 낮아졌지만 안전성·콘텐츠 제약 측면의 운용 고려가 필요하며 비표준 행태를 허용하는 설정은 배포 환경에서 추가 검토가 요구된다.
핵심 역량
- 멀티모달 입력을 받아 시각 정보를 텍스트로 서술하거나 질문에 답할 수 있다. README에는 pipeline_tag가 image-text-to-text로 명시되어 있으며 이미지 입력과의 결합된 출력이 작동함이 테스트되었다. 긴 문맥(기본 262,144 토큰) 처리 능력을 통해 장문 문서·스토리 이어쓰기에서도 문맥 일관성을 유지할 수 있다.
- 창작적 서술과 플롯 생성 역량이 강조되어 소설·장면 묘사·플롯 확장과 같은 creative writing 작업에서 활용될 수 있다. 태그와 설명에 creative, fiction writing, plot generation 등이 포함되어 있으며 bfloat16 포맷으로 효율적 추론이 가능하다. roleplaying 및 다양한 장르의 스토리 기반 생성 작업에서 스타일 유지와 세부 묘사에 유리한 특성이 보고되었다.
- 지식·추론 벤치마크에서 중상급 이상의 성능을 보이며 언어 이해 및 STEM 문제 해결에서 경쟁력 있는 점수를 기록했다. README의 여러 벤치마크 표에서 MMLU-Pro, GPQA Diamond, OmniDocBench 등에서 상위권 점수를 보였고 Performance 섹션의 KL divergence 수치가 낮아 행동 변화가 제한적임이 확인되었다. 멀티언어 지원과 문서·코드 관련 태스크에서도 활용 가능하도록 설계되었다.
강점
- 대규모 지식·추론 벤치마크에서 경쟁력 있는 점수를 보인 점이 강점이다. README 표에서 MMLU-Pro 82.5, GPQA Diamond 81.7, OmniDocBench1.5 87.7 등 상위권 수치가 보고되어 모델의 전반적 언어·문서 이해 능력이 우수함이 확인된다. 또한 KL divergence가 0.0793으로 낮아 파인튜닝 후에도 원본 분포와 크게 벗어나지 않는 안정성을 수치로 입증했다.
- 멀티모달 통합과 긴 컨텍스트 지원으로 문서 이해와 장문 생성에서 실용성이 높다. 기본 262,144 토큰 네이티브 지원 및 최대 1,010,000 토큰 확장 설계는 대형 문서·장편 스토리·코드 기반 태스크에서 일관된 문맥 유지에 이점이 있다. Vision encoder와 결합된 image-text-to-text 파이프라인 태그가 명시되어 있어 시각 질의응답 및 이미지 기반 서술 작업에서 활용 가능하다.
- 배포·호환성 측면에서 표준 도구들과 통합 가능하다는 점이 실무적 장점이다. 모델 아티팩트는 transformers 포맷과 safetensors를 사용하며 Hugging Face Transformers, vLLM, SGLang 등에서 사용 가능한 메타데이터가 포함되어 있다. Apache-2.0 라이선스는 상용·연구 활용에서 제약이 적은 편이다.
훈련 방식
기반 모델은 trohrbaugh/Qwen3.5-9B-heretic-v2이며 Unsloth 툴체인을 사용해 Claude 4.6으로부터 생성된 대규모 distill 데이터로 로컬에서 파인튜닝을 수행했다. 파인튜닝 목적은 'thinking' 스타일과 사고력 관련 행태를 이전하는 것으로 명시되어 있으며 훈련은 기존 성능 저하를 최소화하는 방향으로 설계되었다. 학습 데이터는 대규모 distill 출력으로 구성되었고 bfloat16 형식으로 최적화된 추론/저장 포맷을 사용했다.
알아두면 좋은 것
- 라이선스는 Apache-2.0으로 공개되어 있으며 transformers 포맷과 호환되어 Hugging Face Transformers, vLLM, SGLang 등 기존 추론 스택에서 사용 가능하다.
- 모델은 trohrbaugh/Qwen3.5-9B-heretic-v2를 기반으로 Unsloth를 통해 Claude 4.6 대규모 distill 데이터로 로컬에서 파인튜닝되었고 README에는 'HERETIC'·'uncensored' 성격이 명시되어 있다.
- 기본 컨텍스트 길이는 262,144 토큰이며 확장하여 최대 1,010,000 토큰까지 지원 가능한 아키텍처 사양이 포함되어 있어 장문 문서 처리에 적합하다.
- Performance 섹션에 KL divergence 0.0793과 Refusals 6/100이라는 수치가 기재되어 모델의 행태 변화와 거부율 감소를 정량적으로 보고하고 있다.
기술적 특징
- Claude 4.6 출력으로부터 지식과 '사고 패턴'을 증류하는 방식으로 파인튜닝을 진행해 사고력 관련 생성 성능을 개선했다. README에는 Claude 4.6 large distill dataset으로의 fine tune이 명시되어 있으며 개발자는 이 절차가 벤치마크 성능 개선에 직접 기여했다고 보고했다. 파인튜닝 과정에서 원본 분포와의 이탈을 KL divergence로 측정해 안정성 확보를 시도했다.
- Qwen3.5의 아키텍처적 특성인 Gated DeltaNet과 sparse Mixture-of-Experts 조합이 효율성을 제공한다는 점이 기술적으로 강조되었다. Gated DeltaNet은 게이팅을 통해 표현 보정을 수행하고 sparse MoE는 일부 전문가만 활성화해 추론 효율을 높인다. 이 조합은 멀티모달 토큰의 융합과 고처리량 추론에 유리하도록 설계되었다.
- 긴 컨텍스트 설계를 통한 대역폭 확장이 아키텍처 설계의 핵심 중 하나이다. README에는 네이티브 262,144 토큰 지원과 1,010,000 토큰으로의 확장이 명시되어 있으며 이는 문서·코드·스토리 연속성 유지에서 실질적 이점을 제공한다. 긴 컨텍스트 운용 시 토큰화·메모리·슬라이딩 윈도우 전략과 결합해 사용해야 한다.
차별점
- Claude 4.6에서 유도된 'thinking' 행태를 Qwen3.5-9B 기반에 증류한 점이 주요 차별화 요소다. README는 이 증류가 사고력 생성과 벤치마크 성능을 '대폭' 개선했다고 보고하며 기존 Qwen3.5 사고 스타일을 교체한 것으로 명시되어 있다. 이 접근은 외부 강력 모델의 사고 패턴을 경량 모델로 이전하는 실험적 시도로서 특이점을 가진다.
- HERETIC·uncensored 성격으로 동작 제약을 의도적으로 낮춘 버전이라는 점이 눈에 띈다. README와 태그에서 'HERETIC'과 'uncensored'가 명확히 표기되어 있어 거절률을 대폭 줄이는 방향으로 튜닝되었음이 보고되었다. Performance 섹션의 Refusals 6/100 수치가 거부 행동 감소를 정량화하고 있다.
- 대형 네이티브 롱 컨텍스트와 멀티모달 토큰의 초절합(unified vision-language) 설계 조합으로 문서-이미지 복합 태스크에서 우위를 가질 가능성이 있다. Qwen3.5의 'Unified Vision-Language Foundation' 서술과 본 모델의 image-text-to-text 태그가 결합되어 시각적 이해와 텍스트 생성 간 경계가 낮다. 이 조합은 문서 이해·VQA·스토리 생성 등 교차태스크에서 활용도를 높인다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| KL divergence | value | 0.0793 | original model: 0 (by definition) |
| Refusals | count_per_100 | 6/100 | original model: 100/100 |
| MMLU-Pro | accuracy | 82.5 | — |
| IFEval | accuracy | 91.5 | — |
| OmniDocBench1.5 | accuracy | 87.7 | — |
| VideoMME (with subtitle) | accuracy | 84.5 | — |
이미지 분석

160
Likes
60k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.