1M 컨텍스트와 도구 연동을 갖춘 Qwen3.5 기반 9B 리즈닝 모델
Qwen3.5-9B를 full-parameter로 재학습해 YaRN으로 1,048,576 토큰 컨텍스트와 네이티브 function-calling을 제공하는 9B급 reasoning 모델이다.
TL;DR
Qwythos-9B는 Qwen3.5-9B를 기반으로 모든 텍스트 백본을 full-parameter로 fine-tune해 고도로 구조화된 체인-오브-사고 데이터와 5억 토큰 규모의 Claude Mythos·Fable 트레이스로 후학습한 9B급 reasoning 모델이다. config 수준에서 YaRN rope-scaling factor=4.0을 적용해 로드 시 자동으로 1,048,576 토큰의 장문 컨텍스트를 제공하며 Qwen3.5 스타일의 네이티브 function-calling을 통해 툴 연동과 자가검증 루프를 지원한다. 공식 평가에서는 동일 조건 하에 MMLU에서 +0.343 절대 포인트, gsm8k strict에서 +0.300 절대 포인트 등 reasoning 중심 벤치마크에서 큰 성능 향상을 보고했으며 도구를 통한 7/7 전문 질의 성공 사례를 제시했다. 비전 타워는 동결된 상태로 텍스트만 후학습되었고 모델은 uncensored 설정이므로 민감 도메인에선 배포 시 별도의 검토·안전 레이어를 추가해야 한다.
핵심 역량
- Qwythos는 1,048,576 토큰의 장문 컨텍스트를 사용해 전체 코드베이스나 다수 논문을 단일 포워드 패스에서 통합해 추론할 수 있다. 이 장문 처리 능력은 YaRN 로프 파라미터가 config에 기본 적용되어 로드 시 자동으로 활성화된다. 다만 최대 성능을 얻기 위해서는 KV-cache 오프로딩이나 텐서 병렬화가 권장된다.
- 모델은 Qwen3.5 스타일의 function-calling을 네이티브로 출력해 툴 사용을 직접 지시할 수 있다. 툴 호출은 <tool_call> 블록으로 생성되고 외부 python_executor나 web_search 같은 실행기를 통해 결과를 받아 다시 통합할 수 있다. 문서에선 7개의 어려운 전문 질문에 대해 도구를 통해 출처 인용과 정답 통합을 모두 성공적으로 수행한 사례를 보고했다.
- 체인-오브-사고(<think> 블록) 출력이 기본 동작으로 포함되어 있어 단계별 가설·검증·결론 구조의 추론을 생성한다. 내부 도구 `rethink`로 생성한 CoT 데이터가 후학습에 사용되어 모델이 reasoning-then-answer 패턴을 일관되게 따르도록 유도했다. 출력에서 <think>를 파싱해 최종 답안만 사용자에게 제공하는 파이프라인 구성이 권장된다.
- 샘플링 기본 설정(temperature=0.6, top_p=0.95, top_k=20, repetition_penalty=1.05)이 문서에서 권장되며 이 설정은 장문 reasoning에서 반복 루프를 감소시키는 것으로 보고되었다. max_new_tokens는 <think> 블록과 최종 답안을 위해 넉넉히 16,384 이상을 권장한다. greedy나 매우 낮은 온도에서는 장문 생성 중 반복 및 비정상 동작이 관찰되었다.
강점
- 동일 평가 환경에서 베이스 Qwen3.5-9B 대비 MMLU에서 +0.343 절대 포인트(표시된 평균 0.575) 등 대형 성능 상승을 보고했다. 문서에서 동일한 허니스·샘플링·프롬프트를 사용한 비교 결과를 제공해 성능 향상이 동일 검증 조건 하에서 관측되었음을 뒷받침한다.
- 기본적으로 function-calling을 네이티브로 지원해 별도 래퍼나 도구 전용 파인튜닝 없이 외부 툴과 바로 연동할 수 있다. 도구 연동 평가에서 7/7 성공 사례를 제시해 실제 툴 기반 검증 능력이 문서상 입증되었다.
- 1M 토큰 컨텍스트를 config 수준에서 제공해 전체 코드베이스 분석, 다중 문서 통합, 장기 에이전트 트래젝토리 유지 같은 작업을 단일 포워드 패스로 처리할 수 있게 설계되었다. 이 능력은 RAG 기반 청크 분할을 회피할 수 있어 일부 워크로드에서 파이프라인 단순화와 응답 일관성 개선을 가능하게 한다.
훈련 방식
Qwen3.5-9B를 기반으로 텍스트 백본을 모두 fine-tune한 full-parameter supervised SFT 방식으로 학습했으며 약 5억 토큰의 Claude Mythos·Fable 트레이스와 내부 CoT 생성기 `rethink`로 생성된 체인-오브-사고 데이터를 사용해 reasoning 특화로 후학습했다.
알아두면 좋은 것
- 모델은 Qwen/Qwen3.5-9B를 기반으로 모든 텍스트 백본 가중치를 fine-tune한 full-parameter 모델이며 비전 타워는 동결되어 텍스트 경로만 훈련되었다. 학습에는 약 5억 토큰의 Claude Mythos·Fable 트레이스와 내부 CoT 생성기 `rethink`가 사용되었다. 이 구성은 장문 reasoning과 도구 활용 시 높은 응답성·추론 품질을 목표로 했다.
- 컨텍스트 길이는 config.json에 YaRN 설정으로 기본 포함되어 로드 시 별도 플래그 없이 1,048,576 토큰을 지원한다. 문서에는 vLLM과 SGLang을 이용한 서버 기동 예시와 실제 약 137k 토큰 수준의 스모크 테스트 결과를 함께 제공했다. 다만 YaRN 정적 확장은 짧은 컨텍스트에서 소폭 품질 저하를 가져올 수 있음을 문서에서 명시했다.
- 도구 연동 평가에서 수학·사이버보안·임상 약리학·생화학을 아우르는 7개 시나리오에서 모두 올바른 결과와 출처 인용을 산출했다는 점이 강조되었다. 툴 사용은 모델이 적절한 관측을 선택하고 외부 실행 결과를 통합해 최종 답안을 생성하는 흐름으로 구성되며 전체 대화 텍스트와 툴 출력을 문서화한 로그를 보관하고 있다. 이 결과는 retrieval-augmented agentic 환경에서의 배치 가능성을 시사한다.
- 라이선스는 Apache-2.0이며 모델 가중치는 Hugging Face에 공개되어 다운로드와 엔드포인트 호환이 가능하다. 모델은 의도적으로 uncensored 설정을 유지하므로 민감·위험 도메인 질문에 대해 거부 없이 기술적 응답을 생성한다. 따라서 사용자 전면 배포 시에는 애플리케이션 수준의 안전·검토 레이어를 별도로 적용할 것을 권고하고 있다.
기술적 특징
- 모델은 Qwen3.5-9B의 하이브리드 어텐션 스택을 계승했으며 Gated DeltaNet 기반의 선형 어텐션과 full-attention을 3:1 비율로 혼합해 계산 효율과 표현력을 균형시켰다. 이 구조는 장문 컨텍스트에서 메모리 성능을 개선하면서도 핵심적 전역 상호작용이 필요한 구간에서 full-attention을 유지한다. Qwythos는 이 아키텍처를 유지한 채 텍스트 백본을 전수 학습했다.
- YaRN을 적용한 RoPE 파라미터(factor=4.0)는 원래의 position embedding 상한을 배수로 확장해 1M 토큰 처리를 가능하게 한다. 이 방식은 config.json에 기본값으로 내장되어 로드 시 자동으로 활성화되며 별도 토크나이저 변경이나 런타임 플래그가 필요하지 않다. 단, 문서에서 YaRN의 단점으로 짧은 컨텍스트에서 소폭 품질 손실이 보고되어 작업별 트레이드오프가 존재한다.
- 훈련은 full-parameter supervised fine-tuning으로 진행되었고 assistant-only loss를 사용해 completion 토큰만 손실로 계산했다. 학습 방식은 2단계 커리큘럼(광범위 리즈닝 코퍼스 → 에이전틱·코딩 특화)으로 구성되어 최종 모델이 복합적 문제 해결과 도구 연동에 초점을 맞추도록 설계되었다. 최종 검증에서는 held-out eval_loss ≈ 0.709와 평균 토큰 정확도 0.799가 보고되었다.
- 도구 연동을 위해 Qwen3.5 스타일의 function-calling 스펙을 네이티브로 출력하도록 유지했고, 문서에서는 python_executor와 web_search를 툴로 연결해 자가검증 루프를 구성했다. 툴 호출 결과를 받아 통합하는 과정에서 모델이 소스 인용과 사실 검증을 수행한 사례가 내부 평가에서 제시되었다. 이 파이프라인은 정확한 식별자나 안전 민감 정보가 필요한 작업에서 closed-book 오류를 줄이는 데 기여한다.
차별점
- config 수준에서 YaRN으로 1M 토큰 컨텍스트를 기본 제공해 별도 롱컨텍스트 패치 없이 대규모 컨텍스트를 바로 사용할 수 있다. 이는 9B급 모델에서 드문 기본 제공 기능으로 전체 코드베이스 분석이나 복수 논문 통합 같은 워크로드에서 파이프라인 설계를 단순화한다. 단, YaRN이 짧은 컨텍스트 품질에 미세한 비용을 발생시킬 수 있음을 문서에서 명시했다.
- 네이티브 function-calling 출력과 함께 도구-기반 자가수정(workflow)을 평가 데이터로 검증해 실제 툴 사용 사례에서 7/7 성공을 보고했다는 점이 차별 요소다. 모델은 수학적 계산에서는 python_executor를, 사실 확인에서는 web_search를 선택하는 등 툴 선택 품질이 검증되었다. 이 점은 에이전트 통합 시 별도 도구 핸드라인 없이 즉시 적응 가능성을 높인다.
- 학습 데이터로 Claude Mythos·Fable 트레이스와 내부 생성 CoT를 대규모로 사용해 체계적 reasoning 출력(<think>) 패턴을 강화한 점이 눈에 띈다. 이 데이터 구성은 모델의 추론-우선 출력 흐름을 강화해 단계별 가설 검증을 명시적으로 유도한다. 결과적으로 복합 도메인 질문에서 단계적 추론의 가독성과 추적 가능성이 높아졌다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| gsm8k exact_match (flexible) | exact_match | 0.860 | base Qwen3.5-9B: 0.670 |
| gsm8k exact_match (strict) | exact_match | 0.810 | base Qwen3.5-9B: 0.510 |
| mmlu | acc | 0.575 | base Qwen3.5-9B: 0.232 (Δ +0.343) |
| arc_challenge | acc | 0.490 | base Qwen3.5-9B: 0.470 |
| gpqa_diamond (CoT, 0-shot) exact_match (flexible) | exact_match | 0.580 | base Qwen3.5-9B: 0.630 |
이미지 분석
869
Likes
197.2k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.