empero-ai/Qwythos-27B-v1
Qwen3.5-27B의 MTP·비전·100만 토큰 컨텍스트를 하나도 깎지 않고 그대로 유지한 전수 파인튜닝 에이전트 모델.
학습 방식 · Qwen3.5-27B를 기반으로 full-parameter SFT→DPO→ESFT를 bf16으로 순차 적용했고, assistant 토큰에만 손실을 부여하는 긴 미절단 시퀀스로 도구 호출·터미널 형식 습득에 집중했다. 데이터·하이퍼파라미터는 비공개.
TL;DR
Qwythos-27B-v1은 Qwen3.5-27B를 SFT→DPO→ESFT로 전수 파인튜닝한 pre-RL 체크포인트로, 커뮤니티 27B 파인튜닝이 흔히 포기하는 네이티브 MTP 헤드·전체 비전 타워·YaRN factor 4.0의 1,048,576토큰 컨텍스트를 하나도 깎지 않고 그대로 유지했다. 보류된 터미널·도구 세션에서 assistant 토큰 perplexity가 베이스의 356.6에서 2.76으로 떨어져 도구 호출·터미널 형식을 습득했음을 수치로 보였고, Qwen3.5의 도구 호출 스펙을 템플릿에 그대로 담아 tools=[...]만 넘기면 래퍼 없이 표준 <tool_call> 블록을 낸다. 동일 커리큘럼의 9B보다 닫힌 지식이 늘어, 유기인계 중독 문제에서 9B는 웹 검색이 필요했던 사실(피소스티그민 회피)을 27B는 검색 없이 맞혔다. 기술·연구 목적의 무검열 모델로 사이버보안·의학 등 민감하지만 합법적인 주제에 적극 응답하므로, 별도 정책·검토 절차를 갖춘 에이전트 배포에 적합하다.
핵심 포인트
- 네이티브 MTP 헤드, 전체 비전 타워, YaRN 1,048,576토큰 컨텍스트를 셋 다 깎지 않고 보존했다.
- 보류된 터미널·도구 세션 perplexity가 356.6에서 2.76으로 떨어져 형식 습득이 수치로 확인됐다.
- Qwen3.5 도구 호출 스펙을 템플릿에 담아 tools 인자만 넘기면 표준 도구 호출 블록을 낸다.
- 동일 커리큘럼의 9B보다 닫힌 지식이 늘어 웹 검색 없이도 더 많은 사실을 바로 꺼낼 수 있다.
제한사항
- 비전 타워는 유지됐지만 학습이 텍스트 전용으로 이뤄져 이미지 이해 능력은 베이스에서 물려받은 그대로이고 별도로 튜닝·평가되지 않았다.
- 1,048,576토큰까지 늘린 YaRN factor 4.0은 짧은 컨텍스트에서 품질이 약간 떨어지는 트레이드오프가 있어, 짧은 컨텍스트만 쓴다면 factor를 낮추거나 기본값으로 되돌리는 것이 권장된다.
- 무검열로 설계돼 민감하지만 합법적인 기술 콘텐츠에 적극 응답하므로, 배포자가 직접 정책·검토·접근 제어를 마련해야 한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| 터미널/도구 세션 perplexity | perplexity | 356.6 → 2.76 | 베이스 Qwen3.5-27B 대비 |
149
LIKES
2.4k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.