본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

empero-ai/Qwythos-9B-Claude-Mythos-5-1M-GGUF

장문 추론·도구 호출 대화와 이미지 입력을 지원하는 모델의 GGUF 로컬 실행용 양자화 배포9B1M 컨텍스트apache-2.0

Claude Mythos 스타일 CoT 5억 토큰으로 사후학습해 Qwen3.5-9B보다 MMLU +34점 오른 모델의 GGUF 양자화판.

학습 방식 · Qwen3.5-9B를 기반으로 Empero 자체 rethink 도구가 생성한 Claude Mythos/Fable 스타일 chain-of-thought 트레이스 5억 토큰 이상으로 full-parameter 사후학습했다.

TL;DR

Qwythos-9B-Claude-Mythos-5-1M-GGUF는 Empero가 자체 rethink 도구로 생성한 Claude Mythos/Fable 스타일 chain-of-thought 트레이스 5억 토큰 이상으로 Qwen3.5-9B를 전수 파인튜닝한 Qwythos-9B를 llama.cpp·Ollama·LM Studio 등에서 쓸 수 있게 GGUF로 양자화한 배포판이다. 카드가 인용하는 성능 수치는 모두 상위 모델 Qwythos-9B 본체 카드의 것으로, 베이스 Qwen3.5-9B 대비 MMLU +34점, gsm8k-strict +30점, gsm8k-flex +19점이며 Python 실행기+웹검색 도구를 준 7문항 테스트에서는 닫힌 지식으로 틀렸던 4개를 포함해 7/7을 맞혔다고 적혀 있다(이 GGUF 양자화판을 따로 측정한 값은 아니다). Qwen3.5 규격의 네이티브 도구 호출과 YaRN 기반 1,048,576토큰 컨텍스트를 기본 지원하며, MTP 헤드가 복원된 변형은 llama.cpp의 draft-mtp 추측 디코딩에 바로 쓸 수 있다. 비전 타워는 SFT 동안 동결돼 베이스 Qwen3.5-9B와 동일한 이미지 이해 능력을 그대로 물려받았을 뿐 별도로 검증되지 않았다.

핵심 포인트

  • 베이스 Qwen3.5-9B 대비 MMLU +34점, gsm8k-strict +30점을 상위 모델 본체 카드가 보고한다.
  • Python 실행기+웹검색을 준 7문항 테스트에서 닫힌 지식 오답 4개를 포함해 7/7을 맞혔다고 적혀 있다.
  • Qwen3.5 규격 도구 호출과 YaRN 1M 컨텍스트를 GGUF에 내장하고 MTP 변형은 draft-mtp에 쓴다.
  • 비전 타워는 SFT 동안 동결돼 이미지 이해는 베이스에서 그대로 물려받고 따로 평가되지 않았다.

제한사항

  • 추론 모델 특성상 모든 응답이 <think> 블록으로 시작해 충분한 max_new_tokens를 잡고 최종 사용자에게는 think 블록을 걸러내는 처리가 필요하다.
  • 그리디 디코딩이나 매우 낮은 온도(T≤0.3)를 쓰면 긴 추론 생성에서 반복 루프가 발생할 수 있어 권장 샘플링 설정을 지켜야 한다.
  • 닫힌 지식만으로는 CVE 번호나 약물 용량 같은 특정 식별자에 과신할 수 있어, 안전이 중요한 배포에서는 검색·도구 호출과 함께 써야 한다.

벤치마크

벤치마크지표비교
MMLUpoints delta vs Qwen3.5-9B+34상위 모델 Qwythos-9B 본체 카드의 공개 수치, 이 GGUF 양자화판 측정치 아님
gsm8k-strictpoints delta vs Qwen3.5-9B+30상위 모델 Qwythos-9B 본체 카드의 공개 수치, 이 GGUF 양자화판 측정치 아님
gsm8k-flexpoints delta vs Qwen3.5-9B+19상위 모델 Qwythos-9B 본체 카드의 공개 수치, 이 GGUF 양자화판 측정치 아님
Tool-use self-correction (7-prompt harness)정답률7/7닫힌 지식 실패 4/4 포함. 상위 모델 본체 카드 수치이며 GGUF 측정치 아님

2.5k

LIKES

921.8k

DOWNLOADS

8 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.