hotdogs/qwen3.6-27b-fable5-lora
Qwen3.6-27B를 QLoRA(4-bit NF4)로 LoRA rank=8만 학습해 Fable-5 에이전트 트레이스 기반의 도구 사용·멀티스텝 추론·코드 생성에 특화된 파인튜닝 모델이다.
학습 방식 · 기반 모델 Qwen/Qwen3.6-27B에 QLoRA(4-bit NF4)와 LoRA(r=8)로 SFT를 적용해 Glint-Research/Fable-5-traces 에이전트 세션으로 파인튜닝함.
TL;DR
Qwen3.6-27B를 기반으로 LoRA(r=8) 어댑터만 학습한 QLoRA(4-bit NF4) 파인튜닝이다. 학습 데이터는 Claude Code 에이전트 세션을 수집한 Fable-5-traces로 구성되어 도구 호출 맥락과 멀티스텝 추론, 코드 생성 패턴을 반영한다. 학습은 단일 RTX 4090(24GB)에서 QLoRA로 4-bit 양자화와 bf16 연산을 병행해 수행했으며, 최종적으로 loss 0.2387·accuracy 97.2%를 보고했다. LoRA 타깃(q/k/v/o/gate/up/down_proj)과 r=8 설정, max_length=1024 제한, 학습 기간 18시간·6,999스텝 등 실험 설정이 README에 구체히 기재되어 있다. 이 구성은 제한된 자원으로 에이전트 행동 특화 적응을 빠르게 실험할 수 있게 해 주지만 데이터 규모(4,665행)와 max_length 제약으로 범용적 코드 생성·긴 컨텍스트 처리에는 한계가 있다. 또한 데이터·모델이 AGPL-3.0으로 배포되어 재배포·상업적 이용에 라이선스 제약이 따른다.
핵심 포인트
- Fable-5 agent traces(도구 호출 중심 데이터)를 학습 데이터로 사용해 에이전트 행동·도구 사용에 특화된 파인튜닝임
- Qwen3.6-27B 기반에 QLoRA(4-bit NF4)로 LoRA 어댑터만 학습한 실험적 프로토타입으로, 단일 RTX 4090에서 학습을 완료한 점
- LoRA 타깃을 q/k/v/o/gate/up/down_proj로 상세히 지정해 Attention 및 출력 투영 계층에 직접적인 적응을 시도한 점
- 에이전트 트레이스 데이터에 특화되어 도구 호출이 포함된 시나리오에서 행동·코드 생성 패턴을 학습했다는 점은 에이전트 행동 복제에 직접적 이점이 있다 (데이터: Fable-5-traces, 82.9% tool_use).
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Final Loss | loss | 0.2387 | — |
| Accuracy | accuracy | 97.2% | — |
70
LIKES
452
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.