원본 기능을 보존한 Qwen3.5‑27B 기반 27B 전수 파인튜닝
MTP·비전·1M 토큰을 그대로 살린 Qwen3.5-27B 기반 27B reasoning 모델
TL;DR
Qwythos-27B-v1은 Qwen/Qwen3.5-27B를 베이스로 한 full-parameter 전수 파인튜닝 체크포인트로, SFT→DPO→ESFT 파이프라인을 거쳐 네이티브 MTP 헤드와 전체 비전 타워, YaRN으로 확장된 1,048,576 토큰 컨텍스트를 그대로 유지한다. 도구 호출 스펙을 템플릿에 포함해 `tools=[...]`만으로 표준 <tool_call> 블록을 생성하며, 터미널·도구 세션에서 perplexity가 356.6에서 2.76으로 크게 개선된 수치를 README에서 제시한다. 비전 파라미터는 동결되어 베이스의 이미지 동작을 상속하므로 이미지 성능 개선은 별도 튜닝이 필요하고, uncensored 설정을 고려해 배포 시 정책과 검토 절차를 병행해야 한다.
핵심 역량
- Qwythos-27B는 원본 Qwen3.5-27B 기반의 전수 파인튜닝 체크포인트로, 네이티브 MTP 헤드와 전체 비전 타워를 보존해 멀티토큰 출력과 멀티모달 입출력을 동시에 지원한다. 이 구조는 런타임에서 self-speculative decoding과 도구 사용을 둘 다 활용하려는 배포에 적합하며, MTP가 보존되어 있으면 특정 런타임에서 긴 덩어리 출력을 더욱 효율적으로 생성할 수 있다. 다만 비전 파라미터는 동결되어 있어 이미지 특화 튜닝 효과는 별도로 기대하기 어렵다.
- 장문 컨텍스트 처리를 위해 YaRN factor 4.0으로 확장된 1,048,576 토큰을 네이티브로 지원하므로 긴 대화 히스토리나 대용량 도구 로그를 한 세션에서 유지할 수 있다. README는 수치적 검증을 통해 위치 1,048,575까지 유한성을 확인했다고 명시하므로 극히 긴 시퀀스 실험에 바로 투입할 수 있는 설정을 제공한다. 다만 높은 YaRN factor는 짧은 컨텍스트 품질 저하를 유발할 수 있으므로 필요에 따라 factor를 낮추는 조정이 권장된다.
- 도구 호출과 에이전트적 상호작용을 염두에 둔 학습 파이프라인과 템플릿을 함께 제공하므로, tools 스펙을 전달하면 모델이 표준 <tool_call> 블록을 생성해 외부 함수와 즉시 연동할 수 있다. SFT→DPO→ESFT의 전수 파이프라인은 도구 형식과 터미널 세션 서식의 전이에 특히 효율적이라는 평가 지표를 README에서 제시하고 있다. 따라서 실전 배포에서는 모델이 생성한 도구 호출을 외부 검증기로 확인하는 운영적 안전 장치를 마련해야 한다.
강점
- 가장 뚜렷한 강점은 베이스의 주요 컴포넌트들을 보존한 상태로 전수 파인튜닝을 수행해 멀티토큰 출력과 멀티모달 입력, 초대형 컨텍스트를 동시에 지원한다. 네이티브 MTP 헤드와 전체 비전 타워가 유지되어 런타임에서 베이스 고유의 기능을 그대로 활용할 수 있으므로, MTP를 지원하는 인프라에서는 별도 트레이드오프 없이 성능을 끌어낼 수 있다. 긴 컨텍스트와 도구 사용을 병행하는 에이전트적 워크플로우에서 실제로 유의미한 전이가 발생한 것이 README의 주요 주장이다.
- 터미널·도구 세션에서의 전이 성능 개선이 수치로 제시되어 있어 에이전트적 배포에 적합한 모델이라는 점이 장점이다. 보류된 세트에서 assistant 토큰 perplexity가 356.6에서 2.76으로 하락한 점은 형식적 출력 서식의 습득과 안정적 생성 패턴 복제 능력을 반영한다. 실투입 시에는 생성된 도구 호출을 외부로 검증하는 운영 절차를 병행하면 안전성과 정확도를 높일 수 있다.
- 27B로의 사이즈 업이 닫힌 지식(closed-book) 성능을 개선한 사례가 README에 기술되어 있어, 동일 커리큘럼을 사용한 9B와 비교해 더 많은 사실을 모델 내부에 보유하게 된 점이 실무적 이득을 준다. 예로 유기인 독성 대응에서 27B는 추가 검색 없이 올바른 회피 약물을 제시했다고 서술되어 있다. 그러나 임상적·법적 결정에는 항상 외부 검증과 사람 전문가의 확인이 필요하다는 점도 분명히 경고하고 있다.
훈련 방식
학습 파이프라인은 full-parameter SFT를 시작점으로 DPO를 적용한 다음 ESFT로 마무리되는 연속 단계로 설계되어 있다. 모든 단계는 bf16로 실행되었고 assistant-only loss를 긴 비절단 시퀀스에 적용해 도구 호출과 터미널 형식 적응을 우선한 데이터 스케줄로 훈련이 진행되었다. 구체적 데이터와 하이퍼파라미터는 공개되지 않았으나 파이프라인 구조 자체가 전이된 출력 형식(도구 호출, <think> 블록 등)을 학습하도록 최적화된 점이 핵심이다.
알아두면 좋은 것
- Qwythos-27B-v1은 Qwen/Qwen3.5-27B를 기반으로 한 full-parameter 전수 파인튜닝 체크포인트로서, SFT→DPO→ESFT 순으로 후속 학습을 거친 사전-RL 버전이다. 개발자는 베이스에서 일반적으로 제거되는 MTP 헤드·비전 타워·확장 컨텍스트를 그대로 유지해 커뮤니티 27B 파인튜닝보다 더 많은 원본 기능을 보존했다고 명시하고 있다. 이 릴리스는 후속 RL 버전(v2)을 예고하며 현재는 RL 이전의 사용 가능한 상태로 공개되어 있다.
- 원본 MTP 헤드는 한 층 및 15개 텐서를 문자 그대로 보존해 safetensors 인덱스로 재부착되었으며, 이를 지원하는 런타임에서 self-speculative decoding과 같은 메커니즘을 그대로 활용할 수 있다. 비전 타워는 333개의 비전 텐서와 depth 27, hidden size 1152를 포함한 베이스 파라미터를 그대로 물려받았고 학습 중 동결되어 이미지 동작은 베이스에서 상속된다. 컨텍스트는 네이티브 262,144 토큰에 YaRN factor 4.0을 적용해 1,048,576 토큰을 지원하도록 확장했고 해당 수치적 안정성을 검증했다고 명시되어 있다.
- 터미널·도구 세션 전이 성능이 크게 개선된 점을 README에서 수치로 제시했으며, 보류된 세트에서 assistant 토큰 기준 perplexity가 베이스의 356.6에서 Qwythos 후 2.76으로 낮아졌다고 기록되어 있다. 에뮬레이션된 Claude-Code 세션 사례에서 주입된 nmap 출력으로부터 합리적 도구 호출을 생성한 사례를 예로 들며, 도구·터미널 형식의 표적 습득이 학습 목표였음을 강조하고 있다. 이러한 결과는 모델이 형식적 출력 패턴과 도구 호출 서식을 복제하는 데 성공했음을 시사한다.
- 패키지된 채팅 템플릿은 Qwen3.5의 도구 사용 스펙을 완전하게 포함하므로 별도 래퍼나 도구별 파인튜닝 없이 tools 리스트를 전달하면 표준 도구 호출 블록을 출력한다. 또한 샘플링 권장치는 에이전트적·도구 사용 시 temperature 0.6, 창의적 작업 시 1.0과 같은 구체적 설정을 제공해 실무 적용에 바로 활용할 수 있게 했다. 단, 모델은 uncensored 설정으로 민감하지만 합법적인 기술·사이버보안·의학 질문에 응답하므로 배포 시 별도의 검토·접근 제어 정책을 요구한다.
기술적 특징
- 네이티브 MTP 헤드는 한 층 구성으로 15개의 텐서를 포함하며 safetensors 인덱트를 통해 원본 상태로 재부착되었다. 이로 인해 MTP 관련 런타임 기능을 그대로 활용할 수 있으며, self-speculative decoding 같은 MTP 전용 기법이 동작 가능한 상태로 배포된다. SFT 단계에서는 이 헤드를 건드리지 않았다는 점이 구현상 핵심이다.
- 비전 타워는 베이스의 파라미터를 그대로 계승해 333개의 비전 텐서, depth 27, 비전 히든 1152 및 출력 히든 5120 구조를 유지한다. 본체 텍스트 학습은 텍스트 전용으로 진행되어 비전 파라미터는 동결되었으므로 이미지 동작은 베이스의 품질과 행태를 상속한다. 결과적으로 이미지 관련 성능 개선은 별도 비전 튜닝 없이 베이스 수준이다.
- 컨텍스트 확장은 네이티브 262,144 토큰을 YaRN factor 4.0으로 늘려 1,048,576 토큰을 지원하도록 구성했고, 구성의 수치적 유한성이 위치 1,048,575까지 검증되었다. README는 YaRN factor가 단기 컨텍스트 품질에 부정적 영향을 줄 수 있음을 명시하며, 약 512k 이하 사용 시 factor 2.0을 권장하거나 기본 rope로 복원할 수 있는 설정을 제공한다. 이 구현은 매우 긴 로그·터미널·도구 출력의 단일 세션 처리에 실무적 이점을 제공한다.
- 모델 아키텍처는 Dense Qwen3.5-27B 기반으로, hybrid Gated-DeltaNet linear attention과 3:1 비율의 full-attention 레이어 배치를 사용한다. 텍스트 백본은 64개 hidden layer, hidden size 5120, 24 attention heads 구조를 따르며 어휘는 248,320으로 설정되어 있다. 이러한 구조는 대용량 시퀀스와 복합적 추론을 동시에 처리하도록 설계된 기반을 제공한다.
차별점
- Qwythos-27B는 커뮤니티 파인튜닝에서 흔히 포기되는 요소들을 그대로 유지한 점에서 차별화된다; 특히 네이티브 MTP, 전체 비전 타워, 1,048,576 토큰 컨텍스트를 동시에 보존하고 배포했다는 점이 핵심이다. 이 조합은 도구 사용·멀티토큰 출력·초장문 컨텍스트를 함께 요구하는 에이전트적 응용에 바로 투입할 수 있는 희소한 구성이다. 많은 27B급 파인튜닝이 이들 가운데 하나 이상을 절충하는 반면, Qwythos는 절충 없이 보존한 상태로 공개되었다.
- 패키지된 채팅 템플릿이 Qwen3.5의 도구 스펙을 완전하게 구현하여 `tools=[...]`만 전달하면 별도 래퍼 없이 표준 도구 호출 블록을 생성한다는 점이 실전 배포에서의 편의성을 높인다. 따라서 외부 실행기나 웹서치와의 통합이 비교적 적은 개발 작업으로 가능하며, 에이전트 워크플로우 실험에 바로 활용할 수 있다. 이 기능은 도구 호출 형식 습득을 목표로 한 학습 파이프라인과 맞물려 실효성을 발휘한다.
- GGUF 형식으로의 양자화된 릴리스와 MTP 활성화된 텍스트 양자화 버전 등 실무용 배포 옵션을 함께 제공해 다양한 런타임(예: llama.cpp, Ollama, LM Studio)에서 실험 가능하게 한 점도 차별화 요소다. README는 권장 GGUF 파일명과 이미지용 추가 파일(mmproj)을 명시해 실제 운영 환경으로의 이식성을 고려했다. 이로 인해 대형 모델의 운영적 진입 장벽을 낮춘 배포 전략을 취하고 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| terminal/tool session perplexity | perplexity | 356.6 → 2.76 | vs base Qwen3.5-27B: 356.6 → 2.76 |
52
Likes
392
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.