본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

empero-ai/Qwythos-9B-Claude-Mythos-5-1M

장문 텍스트 생성과 체인-오브-사고형 multi-step reasoning, 도구 호출을 포함한 agentic한 텍스트 생성 태스크를 수행한다.9B1K 컨텍스트apache-2.0

Qwen3.5-9B를 full-parameter로 재학습해 YaRN으로 1,048,576 토큰 컨텍스트와 네이티브 function-calling을 제공하는 9B급 reasoning 모델이다.

학습 방식 · Qwen3.5-9B를 기반으로 텍스트 백본을 모두 fine-tune한 full-parameter supervised SFT 방식으로 학습했으며 약 5억 토큰의 Claude Mythos·Fable 트레이스와 내부 CoT 생성기 `rethink`로 생성된 체인-오브-사고 데이터를 사용해 reasoning 특화로 후학습했다.

TL;DR

Qwythos-9B는 Qwen3.5-9B를 기반으로 모든 텍스트 백본을 full-parameter로 fine-tune해 고도로 구조화된 체인-오브-사고 데이터와 5억 토큰 규모의 Claude Mythos·Fable 트레이스로 후학습한 9B급 reasoning 모델이다. config 수준에서 YaRN rope-scaling factor=4.0을 적용해 로드 시 자동으로 1,048,576 토큰의 장문 컨텍스트를 제공하며 Qwen3.5 스타일의 네이티브 function-calling을 통해 툴 연동과 자가검증 루프를 지원한다. 공식 평가에서는 동일 조건 하에 MMLU에서 +0.343 절대 포인트, gsm8k strict에서 +0.300 절대 포인트 등 reasoning 중심 벤치마크에서 큰 성능 향상을 보고했으며 도구를 통한 7/7 전문 질의 성공 사례를 제시했다. 비전 타워는 동결된 상태로 텍스트만 후학습되었고 모델은 uncensored 설정이므로 민감 도메인에선 배포 시 별도의 검토·안전 레이어를 추가해야 한다.

핵심 포인트

  • config 수준에서 YaRN으로 1M 토큰 컨텍스트를 기본 제공해 별도 롱컨텍스트 패치 없이 대규모 컨텍스트를 바로 사용할 수 있다. 이는 9B급 모델에서 드문 기본 제공 기능으로 전체 코드베이스 분석이나 복수 논문 통합 같은 워크로드에서 파이프라인 설계를 단순화한다. 단, YaRN이 짧은 컨텍스트 품질에 미세한 비용을 발생시킬 수 있음을 문서에서 명시했다.
  • 네이티브 function-calling 출력과 함께 도구-기반 자가수정(workflow)을 평가 데이터로 검증해 실제 툴 사용 사례에서 7/7 성공을 보고했다는 점이 차별 요소다. 모델은 수학적 계산에서는 python_executor를, 사실 확인에서는 web_search를 선택하는 등 툴 선택 품질이 검증되었다. 이 점은 에이전트 통합 시 별도 도구 핸드라인 없이 즉시 적응 가능성을 높인다.
  • 학습 데이터로 Claude Mythos·Fable 트레이스와 내부 생성 CoT를 대규모로 사용해 체계적 reasoning 출력(<think>) 패턴을 강화한 점이 눈에 띈다. 이 데이터 구성은 모델의 추론-우선 출력 흐름을 강화해 단계별 가설 검증을 명시적으로 유도한다. 결과적으로 복합 도메인 질문에서 단계적 추론의 가독성과 추적 가능성이 높아졌다.
  • 동일 평가 환경에서 베이스 Qwen3.5-9B 대비 MMLU에서 +0.343 절대 포인트(표시된 평균 0.575) 등 대형 성능 상승을 보고했다. 문서에서 동일한 허니스·샘플링·프롬프트를 사용한 비교 결과를 제공해 성능 향상이 동일 검증 조건 하에서 관측되었음을 뒷받침한다.

벤치마크

벤치마크지표비교
gsm8k exact_match (flexible)exact_match0.860base Qwen3.5-9B: 0.670
gsm8k exact_match (strict)exact_match0.810base Qwen3.5-9B: 0.510
mmluacc0.575base Qwen3.5-9B: 0.232 (Δ +0.343)
arc_challengeacc0.490base Qwen3.5-9B: 0.470
gpqa_diamond (CoT, 0-shot) exact_match (flexible)exact_match0.580base Qwen3.5-9B: 0.630

이미지 분석

Qwythos와 베이스 Qwen3.5-9B의 여러 벤치마크 비교를 시각화한 성능 그래프이다.
그래프는 동일한 평가 허니스·샘플링·프롬프트 환경에서 Qwythos가 gsm8k와 MMLU 같은 reasoning 중심 벤치마크에서 베이스 대비 큰 상승폭을 보였음을 시각적으로 나타낸다. 특히 gsm8k strict와 flexible, MMLU에서 각각 +0.300, +0.190, +0.343 같은 절대적 개선이 표로도 표시되어 문서의 수치적 주장을 시각적 근거로 뒷받침한다. 단 일부 태스크에서는 개선폭이 미미하거나 역전된 항목도 존재하는데 그래프와 표를 함께 보면 전반적으로 reasoning 관련 항목에서 주목할 만한 성능 향상이 관측된다.

869

LIKES

197.2k

DOWNLOADS

3 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.