1M 컨텍스트와 네이티브 함수 호출을 갖춘 GGUF 9B
Empero가 배포한 Qwythos-9B의 GGUF 양자화판으로 1M 토큰 컨텍스트와 Qwen3.5 규격의 네이티브 함수 호출, 이미지 입력 지원을 제공한다.
TL;DR
Qwythos-9B GGUF 양자화판은 Empero가 Qwythos-9B-Claude-Mythos-5-1M 기반으로 배포한 로컬·경량 런타임 친화형 멀티모달 모델로, GGUF 포맷의 여러 양자화본과 MTP 변종을 제공해 품질과 메모리 요구를 조정할 수 있다. 모델은 Claude Mythos/Fable 트레이스 약 5억 토큰으로 후처리되어 체인오브사고 양식의 내부 추론을 강화했고 동일 조건 평가에서 Qwen3.5-9B 대비 MMLU +34 pts 등 유의미한 성능 상승이 보고되었다. YaRN rope-scaling을 통해 1,048,576토큰의 긴 컨텍스트를 기본으로 지원하며 이미지 입력은 별도의 mmproj 비전 프로젝터 파일을 페어링해 활성화할 수 있다. 다만 SFT는 텍스트 전용으로 수행되어 비전 성능은 기반 모델의 동작을 계승하므로 비전 중심의 사용 사례에서는 별도 검증이 필요하고 uncensored 성격으로 안전 민감 응용에는 추가 검열 레이어가 요구된다. 이 모델은 네이티브 함수 호출 출력과 장문 추론을 필요로 하는 워크플로에 직접 연결할 수 있는 실용적 대안이다.
핵심 역량
- 장문 컨텍스트 환경에서 1,048,576토큰까지 입력을 유지한 채 추론을 수행할 수 있다.
- Qwen3.5 규격의 네이티브 함수 호출을 출력 형식으로 내보내 도구 연동 워크플로에 곧바로 연결할 수 있다.
- 이미지 입력을 처리하기 위해 CLIP 스타일의 mmproj 비전 프로젝터를 페어링하면 이미지-텍스트 결합 응답을 생성할 수 있다.
- 체인오브사고(chain-of-thought) 형식의 내부 추론 블록(`<think>...</think>`)을 포함한 출력 패턴을 기본으로 사용하므로 추론 과정 검토와 도구 결합이 용이하다.
강점
- 대조 평가에서 동일한 평가 조건으로 Qwen3.5-9B 대비 MMLU +34 pts, gsm8k-strict +30 pts, gsm8k-flex +19 pts의 성능 향상이 보고되어 규범적 언어 추론 능력이 향상되었음이 나타났다.
- GGUF 양자화 파일과 mmproj 비전 프로젝터 조합으로 로컬 및 경량 런타임(llama.cpp, Ollama, LM Studio 등)에서 실용적으로 멀티모달 추론을 구현할 수 있다는 점이 운영상 장점이다.
훈련 방식
기반 모델 Qwythos-9B는 전체 파라미터 기반으로 Claude Mythos 및 Claude Fable 트레이스 약 5억 토큰을 이용해 post-training 및 SFT를 수행했고 체인오브사고(Chain-of-Thought) 스타일의 내부 추론 토큰을 포함하도록 사내 도구 'rethink'로 생성된 데이터가 사용되었다.
알아두면 좋은 것
- 기본 권장 양자화는 Q4_K_M으로, 크기와 품질을 균형 있게 유지하는 실용적 시작점으로 제안된다.
- MTP 변종은 Qwen3.5 호환 투기적 생성(draft speculation)을 위해 복원된 MTP 헤드를 포함하며 관련 런타임에서만 활성화된다.
- 비전 경로는 Qwen3.5-9B의 비전 타워를 그대로 계승했으며 SFT 과정에서는 비전이 동결되어 텍스트 전용으로 후처리되었다는 점이 명시되어 있다.
- 배포판은 'uncensored' 성격을 가지므로 안전 민감 응용에서는 별도 검토 및 필터링 레이어를 추가해야 한다.
기술적 특징
- 모델은 전체 파라미터를 유지한 채로 Claude Mythos/Fable 트레이스 약 500백만 토큰으로 후처리(post-training)가 이루어졌으며, 이 데이터는 chain-of-thought 표기를 포함해 내부 추론 기제를 강화하도록 설계되었다. 후처리 데이터는 사내 'rethink' 도구로 생성되었고 그 결과 체계적인 추론 능력 향상이 보고되었다.
- YaRN rope-scaling이 기본으로 활성화되어 1,048,576토큰의 확장된 컨텍스트 윈도우를 제공한다. 이 확장은 position encoding의 스케일링 및 KV 캐시 운영 변화로 구현되어 장문 문서와 누적 문맥을 필요로 하는 작업에서 모델의 연속성 유지가 가능해졌다.
- GGUF 포맷으로 여러 양자화 레벨(Q4_K_M, Q5_K_M, Q6_K, Q8_0 등)과 BF16 변환본을 제공해 사용자가 품질과 메모리 제약에 따라 선택하도록 구성되었다. 특히 Q4_K_M이 권장 기본값으로 제시되어 실용적 호환성과 품질 보존 사이의 균형을 맞추었다.
- MTP(투기적 생성을 위한 헤드)를 포함한 변종이 별도로 제공되며 해당 변종은 런타임이 draft-mtp 스펙을 지원할 때 성능·추론 효율을 개선할 수 있다. MTP가 활성화되지 않는 환경에서는 기본 fixed v3 파일을 사용하도록 권장된다.
- 비전 경로는 Qwen3.5-9B의 비전 타워를 동결한 상태로 계승했기 때문에 이미지 입력 처리 방식과 출력 행태는 기반 모델과 동일하다. 다만 SFT가 텍스트 전용으로 수행되어 비전 관련 추가 학습이나 별도의 검증이 필요하다는 한계가 존재한다.
차별점
- 1,048,576토큰의 YaRN 기반 긴 컨텍스트를 기본으로 제공해 대규모 문서 집적과 연속 추론 작업에서 다른 9B급 모델과 차별화된다.
- Claude Mythos/Fable 체인오브사고 트레이스로 후처리된 전용 데이터셋을 사용해 추론 응답에 보이는 사고 단계(`<think>...</think>`)를 출력 패턴으로 통합한다는 점이 운영적 차별점이다.
- 로컬 경량 런타임과 호환되는 GGUF 양자화본을 다수 제공함으로써 실전 배포에서 메모리·호환성 선택지를 넓혔다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU | delta | +34 pts | vs Qwen3.5-9B |
| gsm8k-strict | delta | +30 pts | vs Qwen3.5-9B |
| gsm8k-flex | delta | +19 pts | vs Qwen3.5-9B |
2.5k
Likes
1M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.