본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

lordx64/Qwable-v1

대화형 텍스트 생성(코드 작성·편집·명령 실행 지시), 에이전트형 도구 호출(파일 읽기/쓰기/편집, 쉘 커맨드, 웹 페치), 체인오브쏘트 기반 추론 및 일반 챗 어시스턴스35B (MoE, 3B active)4K 컨텍스트agpl-3.0

Qwen3.6-35B 기반에 Opus 4.7 추론 증류와 Fable-5 에이전트 SFT를 연쇄 적용해 <think> CoT와 시스템-프롬프트 조건의 <tool_use> XML을 생성하는 35B MoE 코딩 에이전트 모델이다.

학습 방식 · Qwen3.6-35B-A3B 기반을 warm-start로 하고 Opus 4.7 reasoning distill 위에 Fable-5 agentic traces로 SFT를 수행했으며, attention-only LoRA(r=16, alpha=16)와 train_on_responses_only 손실 마스킹을 사용했다.

TL;DR

Qwable-v1은 Qwen3.6-35B-A3B를 출발점으로 연쇄적인 SFT를 적용한 35B MoE 코딩 에이전트 모델이다. 먼저 Qwen3.6을 Opus 4.7 추론 흔적으로 증류하고, 그 위에 Fable-5 에이전트 도구 사용 흔적을 SFT로 추가해 추론 능력은 유지하면서 에이전트형 도구 호출 행태를 덧붙였다. 모델은 체인오브쏘트(<think>…</think>)를 보존하고 시스템 프롬프트 또는 선행 <tool_result>가 주어질 때 <tool_use> XML 블록을 출력해 파일 읽기·편집·쉘 호출 등 도구 사용을 표기한다. 학습에서는 attention-only LoRA(r=16)와 응답 기반 손실 마스킹(train_on_responses_only)을 사용했고, 병합된 bf16 가중치(~70GB), adapter-only PEFT(~50–100MB), GGUF 양자화(IQ4_XS/Q5_K_M/Q8_0)로 다양한 실행 환경을 지원한다. 의미적으로 Qwable-v1은 '순수 추론의 향상'보다는 '에이전트형 도구 사용 능력'에 초점을 맞춘 모델이다. 학습 데이터가 단일 개발자 세션 중심으로 약 4.6k 행에 한정되어 분포가 좁고, 도구 호출 포맷은 시스템 프롬프트 조건에 따라 달라지며 정식 벤치마크 결과는 v1 시점에서 아직 공개되지 않았다.

핵심 포인트

  • 연쇄 SFT 파이프라인으로 추론 prior(Opus 4.7)와 에이전트 행동(Fable-5)을 분리해 순차적으로 전이한 점.
  • 시스템 프롬프트 조건으로만 활성화되는 <tool_use> XML 도구 호출 포맷을 학습해 에이전트용 출력 형태를 명시적으로 보유한 점.
  • 35B MoE 구성(활성화 3B)과 함께 adapter-only PEFT, 그리고 GGUF 양자화 라인업을 같이 제공해 연구·프로덕션 양쪽 용도를 지원하는 배포 옵션.
  • 에이전트형 도구 호출 행동을 명시적 XML(<tool_use>)로 출력하도록 SFT로 특화되어 있어, 같은 베이스(Qwen3.6) 대비 에이전트 코딩 시 더 일관된 도구호출 패턴을 보인다고 명시되어 있다.

184

LIKES

6.6k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.