Qwen3.6에 Fable-5 에이전트 행동을 쌓아 만든 오픈 코딩 에이전트
Qwen3.6-35B 기반에 Opus 4.7 추론 증류와 Fable-5 에이전트 SFT를 연쇄 적용해 <think> CoT와 시스템-프롬프트 조건의 <tool_use> XML을 생성하는 35B MoE 코딩 에이전트 모델이다.
TL;DR
Qwable-v1은 Qwen3.6-35B-A3B를 출발점으로 연쇄적인 SFT를 적용한 35B MoE 코딩 에이전트 모델이다. 먼저 Qwen3.6을 Opus 4.7 추론 흔적으로 증류하고, 그 위에 Fable-5 에이전트 도구 사용 흔적을 SFT로 추가해 추론 능력은 유지하면서 에이전트형 도구 호출 행태를 덧붙였다. 모델은 체인오브쏘트(<think>…</think>)를 보존하고 시스템 프롬프트 또는 선행 <tool_result>가 주어질 때 <tool_use> XML 블록을 출력해 파일 읽기·편집·쉘 호출 등 도구 사용을 표기한다. 학습에서는 attention-only LoRA(r=16)와 응답 기반 손실 마스킹(train_on_responses_only)을 사용했고, 병합된 bf16 가중치(~70GB), adapter-only PEFT(~50–100MB), GGUF 양자화(IQ4_XS/Q5_K_M/Q8_0)로 다양한 실행 환경을 지원한다. 의미적으로 Qwable-v1은 '순수 추론의 향상'보다는 '에이전트형 도구 사용 능력'에 초점을 맞춘 모델이다. 학습 데이터가 단일 개발자 세션 중심으로 약 4.6k 행에 한정되어 분포가 좁고, 도구 호출 포맷은 시스템 프롬프트 조건에 따라 달라지며 정식 벤치마크 결과는 v1 시점에서 아직 공개되지 않았다.
핵심 역량
- 체인오브쏘트(<think>…</think>)를 포함한 추론적 응답을 생성한다.
- 시스템 프롬프트 조건 하에서 <tool_use> XML 블록을 출력해 파일 읽기·쓰기·편집·쉘 호출 같은 도구 호출을 표기한다.
- 에이전트 흐름(선행 <tool_result> 포함)을 이어가는 멀티턴 대화를 처리한다.
- 베이스(Opus 4.7) 추론 prior로 일반적인 수리·지식 질문에 대해 일관된 추론을 반환한다.
- adapter(PEFT) 변형으로 Opus 4.7 베이스에 합성해 동일한 동작을 경량하게 적용할 수 있다.
강점
- 에이전트형 도구 호출 행동을 명시적 XML(<tool_use>)로 출력하도록 SFT로 특화되어 있어, 같은 베이스(Qwen3.6) 대비 에이전트 코딩 시 더 일관된 도구호출 패턴을 보인다고 명시되어 있다.
- 오픈웨이트로 bf16 merged weights와 adapter-only 변형을 제공해 베이스와 조합·재현이 가능하며, GGUF 양자화 브랜치로 24GB 소비자 GPU에서도 실행할 수 있다.
- 학습 비용·시간이 공개되어 있어 소형 실험에서 재현성(14.1시간, 약 $70)이 확인된 점이 실용적 이점으로 제시되었다.
훈련 방식
Qwen3.6-35B-A3B 기반을 warm-start로 하고 Opus 4.7 reasoning distill 위에 Fable-5 agentic traces로 SFT를 수행했으며, attention-only LoRA(r=16, alpha=16)와 train_on_responses_only 손실 마스킹을 사용했다.
알아두면 좋은 것
- 연쇄 파이프라인: Qwen3.6-35B-A3B → Opus 4.7 reasoning distill → Fable-5 agentic SFT로 단계별로 SFT가 적용되었다.
- 학습 데이터는 lordx64/agentic-distill-fable-5-sft(4,659행, 약 12.2M Qwen 토큰)로, 약 81%가 도구 호출로 끝나는 좁은 도메인(게임·웹·Three.js 등)이다.
- 배포형태: 병합된 bf16 가중치(약 70GB)와 adapter-only PEFT(50–100MB), GGUF 양자화(IQ4_XS ≈18GB 등) 세 가지 실행 옵션을 제공한다.
- 라이선스는 AGPL-3.0이며, Fable-5 상위 데이터의 법적·소스 가용성(일시적 중단) 문제로 추가 데이터 확보 경로가 불확실하다고 명시했다.
기술적 특징
- MoE 아키텍처(35B, 3B active)를 사용해 전체 파라미터를 크게 유지하면서 실행 시 활성화되는 전문가 집합을 제한해 표현력을 확보했다. 이 설계는 대형 파라미터 예산을 활용하되 실사용에서의 연산·메모리 부담을 관리하는 목적이다.
- 연쇄 증류(chained distill) 접근을 적용해 먼저 Opus 4.7의 추론적 prior를 SFT로 전이하고, 그 위에 Fable-5의 에이전트 도구 사용 로그를 추가로 SFT했다. 이로 인해 추론 능력은 Opus 4.7이 유지되고, 에이전트 도구 사용 패턴은 후속 SFT에서 주입되도록 역할을 분리했다.
- 학습 과정에서는 attention-only LoRA(r=16, alpha=16)를 사용해 어텐션 투영층만 보정하도록 설정했고, train_on_responses_only 손실 마스킹으로 어시스턴트 턴(예: <think> 블록)에만 그래디언트를 흐르게 했다. 이 조합으로 짧은 단계에서 에이전트 동작을 주입하면서 베이스 가중치는 보존되었다.
- 배포·실행 효율화를 위해 병합 bf16 가중치(약 70GB)와 함께 adapter-only PEFT(50–100MB)를 제공하고, GGUF 양자화(IQ4_XS, Q5_K_M, Q8_0)를 통해 24GB~64+GB 환경까지 품질/메모리 트레이드오프를 지원한다.
- 학습 파이프라인에서 GatedDeltaNet 등의 가속 경로가 런타임 툴체인 문제로 fallback돼 훈련 시간이 2–3× 늘어나는 운영 리스크를 명시했다. 수학적 수렴성은 유지되나 빌드·환경 의존성이 성능·시간에 직접 영향을 미쳤다.
차별점
- 연쇄 SFT 파이프라인으로 추론 prior(Opus 4.7)와 에이전트 행동(Fable-5)을 분리해 순차적으로 전이한 점.
- 시스템 프롬프트 조건으로만 활성화되는 <tool_use> XML 도구 호출 포맷을 학습해 에이전트용 출력 형태를 명시적으로 보유한 점.
- 35B MoE 구성(활성화 3B)과 함께 adapter-only PEFT, 그리고 GGUF 양자화 라인업을 같이 제공해 연구·프로덕션 양쪽 용도를 지원하는 배포 옵션.
184
Likes
6.6k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.