lordx64/Qwable-v1
Qwen3.6-35B 기반에 Opus 4.7 추론 증류와 Fable-5 에이전트 SFT를 연쇄 적용해 <think> CoT와 시스템-프롬프트 조건의 <tool_use> XML을 생성하는 35B MoE 코딩 에이전트 모델이다.
학습 방식 · Qwen3.6-35B-A3B 기반을 warm-start로 하고 Opus 4.7 reasoning distill 위에 Fable-5 agentic traces로 SFT를 수행했으며, attention-only LoRA(r=16, alpha=16)와 train_on_responses_only 손실 마스킹을 사용했다.
TL;DR
Qwable-v1은 Qwen3.6-35B-A3B를 출발점으로 연쇄적인 SFT를 적용한 35B MoE 코딩 에이전트 모델이다. 먼저 Qwen3.6을 Opus 4.7 추론 흔적으로 증류하고, 그 위에 Fable-5 에이전트 도구 사용 흔적을 SFT로 추가해 추론 능력은 유지하면서 에이전트형 도구 호출 행태를 덧붙였다. 모델은 체인오브쏘트(<think>…</think>)를 보존하고 시스템 프롬프트 또는 선행 <tool_result>가 주어질 때 <tool_use> XML 블록을 출력해 파일 읽기·편집·쉘 호출 등 도구 사용을 표기한다. 학습에서는 attention-only LoRA(r=16)와 응답 기반 손실 마스킹(train_on_responses_only)을 사용했고, 병합된 bf16 가중치(~70GB), adapter-only PEFT(~50–100MB), GGUF 양자화(IQ4_XS/Q5_K_M/Q8_0)로 다양한 실행 환경을 지원한다. 의미적으로 Qwable-v1은 '순수 추론의 향상'보다는 '에이전트형 도구 사용 능력'에 초점을 맞춘 모델이다. 학습 데이터가 단일 개발자 세션 중심으로 약 4.6k 행에 한정되어 분포가 좁고, 도구 호출 포맷은 시스템 프롬프트 조건에 따라 달라지며 정식 벤치마크 결과는 v1 시점에서 아직 공개되지 않았다.
핵심 포인트
- 연쇄 SFT 파이프라인으로 추론 prior(Opus 4.7)와 에이전트 행동(Fable-5)을 분리해 순차적으로 전이한 점.
- 시스템 프롬프트 조건으로만 활성화되는 <tool_use> XML 도구 호출 포맷을 학습해 에이전트용 출력 형태를 명시적으로 보유한 점.
- 35B MoE 구성(활성화 3B)과 함께 adapter-only PEFT, 그리고 GGUF 양자화 라인업을 같이 제공해 연구·프로덕션 양쪽 용도를 지원하는 배포 옵션.
- 에이전트형 도구 호출 행동을 명시적 XML(<tool_use>)로 출력하도록 SFT로 특화되어 있어, 같은 베이스(Qwen3.6) 대비 에이전트 코딩 시 더 일관된 도구호출 패턴을 보인다고 명시되어 있다.
184
LIKES
6.6k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.