본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

DavidAU/Qwen3.5-9B-Claude-4.6-HighIQ-THINKING-HERETIC-UNCENSORED

이미지와 텍스트를 함께 입력받아 텍스트 출력을 생성하는 멀티모달 image-text-to-text 태스크를 주된 용도로 하며 스토리 생성, 장문 응답, 시각 질의응답, 문서 이해 등 다양한 생성·추론 작업을 처리한다.9B262K 컨텍스트apache-2.0

Qwen3.5-9B를 기반으로 Claude 4.6의 대규모 distill 데이터로 로컬에서 파인튜닝한 멀티모달(image-text-to-text) 모델로서 사고력(’thinking’) 성능과 시각 입력 처리 능력을 개선한 모델이다.

학습 방식 · 기반 모델은 trohrbaugh/Qwen3.5-9B-heretic-v2이며 Unsloth 툴체인을 사용해 Claude 4.6으로부터 생성된 대규모 distill 데이터로 로컬에서 파인튜닝을 수행했다. 파인튜닝 목적은 'thinking' 스타일과 사고력 관련 행태를 이전하는 것으로 명시되어 있으며 훈련은 기존 성능 저하를 최소화하는 방향으로 설계되었다. 학습 데이터는 대규모 distill 출력으로 구성되었고 bfloat16 형식으로 최적화된 추론/저장 포맷을 사용했다.

TL;DR

이 모델은 trohrbaugh의 Qwen3.5-9B-heretic-v2를 기반으로 Unsloth를 이용해 Claude 4.6으로부터 생성된 대규모 distill 데이터로 로컬 파인튜닝한 멀티모달(image-text-to-text) 파인튜닝 모델이다. 파인튜닝 목적은 Claude 4.6의 'thinking' 스타일을 이식해 사고력 관련 생성과 벤치마크 성능을 향상시키는 것이며 README의 벤치마크 표와 Performance 수치(KL divergence 0.0793, Refusals 6/100)가 이러한 변화의 정량적 근거를 제공한다. 아키텍처적으로는 Qwen3.5의 Gated DeltaNet과 sparse Mixture-of-Experts 조합, 네이티브 262,144 토큰의 롱 컨텍스트 지원이 결합되어 멀티모달 이해와 장문 생성에서 실용적 이점을 제공한다. 단점으로는 'HERETIC'·'uncensored'라는 동작 특성 표기에 따라 거부율이 낮아졌지만 안전성·콘텐츠 제약 측면의 운용 고려가 필요하며 비표준 행태를 허용하는 설정은 배포 환경에서 추가 검토가 요구된다.

핵심 포인트

  • Claude 4.6에서 유도된 'thinking' 행태를 Qwen3.5-9B 기반에 증류한 점이 주요 차별화 요소다. README는 이 증류가 사고력 생성과 벤치마크 성능을 '대폭' 개선했다고 보고하며 기존 Qwen3.5 사고 스타일을 교체한 것으로 명시되어 있다. 이 접근은 외부 강력 모델의 사고 패턴을 경량 모델로 이전하는 실험적 시도로서 특이점을 가진다.
  • HERETIC·uncensored 성격으로 동작 제약을 의도적으로 낮춘 버전이라는 점이 눈에 띈다. README와 태그에서 'HERETIC'과 'uncensored'가 명확히 표기되어 있어 거절률을 대폭 줄이는 방향으로 튜닝되었음이 보고되었다. Performance 섹션의 Refusals 6/100 수치가 거부 행동 감소를 정량화하고 있다.
  • 대형 네이티브 롱 컨텍스트와 멀티모달 토큰의 초절합(unified vision-language) 설계 조합으로 문서-이미지 복합 태스크에서 우위를 가질 가능성이 있다. Qwen3.5의 'Unified Vision-Language Foundation' 서술과 본 모델의 image-text-to-text 태그가 결합되어 시각적 이해와 텍스트 생성 간 경계가 낮다. 이 조합은 문서 이해·VQA·스토리 생성 등 교차태스크에서 활용도를 높인다.
  • 대규모 지식·추론 벤치마크에서 경쟁력 있는 점수를 보인 점이 강점이다. README 표에서 MMLU-Pro 82.5, GPQA Diamond 81.7, OmniDocBench1.5 87.7 등 상위권 수치가 보고되어 모델의 전반적 언어·문서 이해 능력이 우수함이 확인된다. 또한 KL divergence가 0.0793으로 낮아 파인튜닝 후에도 원본 분포와 크게 벗어나지 않는 안정성을 수치로 입증했다.

벤치마크

벤치마크지표비교
KL divergencevalue0.0793original model: 0 (by definition)
Refusalscount_per_1006/100original model: 100/100
MMLU-Proaccuracy82.5
IFEvalaccuracy91.5
OmniDocBench1.5accuracy87.7
VideoMME (with subtitle)accuracy84.5

이미지 분석

이미지는 여러 모델을 기준으로 복수의 벤치마크에서 성능 바 차트를 모아 비교한 그래프이다. 각 벤치마크별로 모델별 점수가 막대 형태로 표기되어 있으며 범례로 모델명을 색상으로 구분하고 있다. 이 그래프는 README의 수치 테이블을 시각적으로 요약해 특정 벤치마크에서 Qwen3.5-9B의 상대적 위치를 확인할 수 있게 한다.
그래프는 Qwen3.5-9B가 다수의 벤치마크에서 상위권에 위치함을 보여주며 특히 일부 멀티모달·추론 항목에서 다른 대형 모델과 유사하거나 더 높은 점수를 보이는 패턴이 관찰된다. 시각적 비교는 표 형식의 세부 수치와 일치하며 모델 간 상대 성능 차이를 빠르게 파악하는 데 적합하다. 그래프 자체는 수치 표기와 색상 범례만으로 해석 가능하므로 README 표와 함께 근거로 활용할 수 있다.

160

LIKES

60k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.