empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF
Claude Mythos 스타일 CoT 5억 토큰으로 사후학습해 Qwen3.5-9B보다 MMLU +34점 오른 모델의 GGUF 양자화판.
학습 방식 · Qwen3.5-9B를 기반으로 Empero 자체 rethink 도구가 생성한 Claude Mythos/Fable 스타일 chain-of-thought 트레이스 5억 토큰 이상으로 full-parameter 사후학습했다.
TL;DR
Qwythos-9B-Claude-Mythos-5-1M-GGUF는 Empero가 자체 rethink 도구로 생성한 Claude Mythos/Fable 스타일 chain-of-thought 트레이스 5억 토큰 이상으로 Qwen3.5-9B를 전수 파인튜닝한 Qwythos-9B를 llama.cpp·Ollama·LM Studio 등에서 쓸 수 있게 GGUF로 양자화한 배포판이다. 카드가 인용하는 성능 수치는 모두 상위 모델 Qwythos-9B 본체 카드의 것으로, 베이스 Qwen3.5-9B 대비 MMLU +34점, gsm8k-strict +30점, gsm8k-flex +19점이며 Python 실행기+웹검색 도구를 준 7문항 테스트에서는 닫힌 지식으로 틀렸던 4개를 포함해 7/7을 맞혔다고 적혀 있다(이 GGUF 양자화판을 따로 측정한 값은 아니다). Qwen3.5 규격의 네이티브 도구 호출과 YaRN 기반 1,048,576토큰 컨텍스트를 기본 지원하며, MTP 헤드가 복원된 변형은 llama.cpp의 draft-mtp 추측 디코딩에 바로 쓸 수 있다. 비전 타워는 SFT 동안 동결돼 베이스 Qwen3.5-9B와 동일한 이미지 이해 능력을 그대로 물려받았을 뿐 별도로 검증되지 않았다.
핵심 포인트
- 베이스 Qwen3.5-9B 대비 MMLU +34점, gsm8k-strict +30점을 상위 모델 본체 카드가 보고한다.
- Python 실행기+웹검색을 준 7문항 테스트에서 닫힌 지식 오답 4개를 포함해 7/7을 맞혔다고 적혀 있다.
- Qwen3.5 규격 도구 호출과 YaRN 1M 컨텍스트를 GGUF에 내장하고 MTP 변형은 draft-mtp에 쓴다.
- 비전 타워는 SFT 동안 동결돼 이미지 이해는 베이스에서 그대로 물려받고 따로 평가되지 않았다.
제한사항
- 추론 모델 특성상 모든 응답이 <think> 블록으로 시작해 충분한 max_new_tokens를 잡고 최종 사용자에게는 think 블록을 걸러내는 처리가 필요하다.
- 그리디 디코딩이나 매우 낮은 온도(T≤0.3)를 쓰면 긴 추론 생성에서 반복 루프가 발생할 수 있어 권장 샘플링 설정을 지켜야 한다.
- 닫힌 지식만으로는 CVE 번호나 약물 용량 같은 특정 식별자에 과신할 수 있어, 안전이 중요한 배포에서는 검색·도구 호출과 함께 써야 한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU | points delta vs Qwen3.5-9B | +34 | 상위 모델 Qwythos-9B 본체 카드의 공개 수치, 이 GGUF 양자화판 측정치 아님 |
| gsm8k-strict | points delta vs Qwen3.5-9B | +30 | 상위 모델 Qwythos-9B 본체 카드의 공개 수치, 이 GGUF 양자화판 측정치 아님 |
| gsm8k-flex | points delta vs Qwen3.5-9B | +19 | 상위 모델 Qwythos-9B 본체 카드의 공개 수치, 이 GGUF 양자화판 측정치 아님 |
| Tool-use self-correction (7-prompt harness) | 정답률 | 7/7 | 닫힌 지식 실패 4/4 포함. 상위 모델 본체 카드 수치이며 GGUF 측정치 아님 |
2.5k
LIKES
921.8k
DOWNLOADS
8 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.