Qwen3.6을 LoRA+QLoRA로 적응시킨 에이전트용 코드 생성 특화 모델
Qwen3.6-27B를 QLoRA(4-bit NF4)로 LoRA rank=8만 학습해 Fable-5 에이전트 트레이스 기반의 도구 사용·멀티스텝 추론·코드 생성에 특화된 파인튜닝 모델이다.
TL;DR
Qwen3.6-27B를 기반으로 LoRA(r=8) 어댑터만 학습한 QLoRA(4-bit NF4) 파인튜닝이다. 학습 데이터는 Claude Code 에이전트 세션을 수집한 Fable-5-traces로 구성되어 도구 호출 맥락과 멀티스텝 추론, 코드 생성 패턴을 반영한다. 학습은 단일 RTX 4090(24GB)에서 QLoRA로 4-bit 양자화와 bf16 연산을 병행해 수행했으며, 최종적으로 loss 0.2387·accuracy 97.2%를 보고했다. LoRA 타깃(q/k/v/o/gate/up/down_proj)과 r=8 설정, max_length=1024 제한, 학습 기간 18시간·6,999스텝 등 실험 설정이 README에 구체히 기재되어 있다. 이 구성은 제한된 자원으로 에이전트 행동 특화 적응을 빠르게 실험할 수 있게 해 주지만 데이터 규모(4,665행)와 max_length 제약으로 범용적 코드 생성·긴 컨텍스트 처리에는 한계가 있다. 또한 데이터·모델이 AGPL-3.0으로 배포되어 재배포·상업적 이용에 라이선스 제약이 따른다.
핵심 역량
- 도구 호출이 포함된 에이전트 세션의 행동을 모방해 Bash/Read/Write/Edit/Glob/Grep 등 도구 사용 맥락에서 응답 생성
- 코드 생성 및 수정: 멀티스텝 추론을 포함한 코드 작성·편집 응답을 생성
- 대화형 텍스트 생성: 채팅 템플릿을 적용한 에이전트 스타일 응답 생성
- 로컬 추론 지원: PEFT(PeftModel)와 GGUF LoRA를 통해 양자화된 런타임(llama.cpp 계열)에서 어댑터 로드 가능
강점
- 에이전트 트레이스 데이터에 특화되어 도구 호출이 포함된 시나리오에서 행동·코드 생성 패턴을 학습했다는 점은 에이전트 행동 복제에 직접적 이점이 있다 (데이터: Fable-5-traces, 82.9% tool_use).
- LoRA 어댑터(r=8) + QLoRA(4-bit NF4) 조합으로 단일 RTX 4090 환경에서 파인튜닝을 수행했다는 점은 제한된 자원으로도 적응이 가능함을 보여준다.
훈련 방식
기반 모델 Qwen/Qwen3.6-27B에 QLoRA(4-bit NF4)와 LoRA(r=8)로 SFT를 적용해 Glint-Research/Fable-5-traces 에이전트 세션으로 파인튜닝함.
알아두면 좋은 것
- 모델과 파생 데이터셋은 AGPL-3.0 라이선스로 배포되며, 이 모델은 데이터셋의 파생 저작물로서 동일한 라이선스 적용 대상이다.
- 학습 데이터는 Glint-Research/Fable-5-traces로 구성되며 데이터 내 82.9%가 도구 호출 액션, 17.1%가 텍스트로 이루어져 있다.
- 학습은 QLoRA(4-bit NF4) + LoRA r=8로 수행되었고, LoRA 타깃은 q/k/v/o/gate/up/down_proj로 설정되었다.
- 모델의 max_length는 1024로 제한되어 있으며, 이는 vocab=248K로 인해 24GB VRAM 환경에서 시퀀스 길이 증가 시 OOM이 발생하기 때문이다.
기술적 특징
- LoRA(r=8)를 사용해 전체 모델 가중치는 고정하고 저순위 어댑터만 학습했다. 이 모델은 LoRA 타깃을 q/k/v/o/gate/up/down_proj로 지정해 Attention과 출력 투영 계층의 표현을 국소적으로 조정했다.
- 양자화는 4-bit NF4 형식을 사용하고 연산은 bf16으로 수행했다. QLoRA로 모델을 4-bit로 양자화한 뒤 bf16 연산을 유지해 VRAM 사용을 낮추면서도 수치 안정성을 확보했다.
- 학습 옵티마이저·설정은 paged_adamw_8bit, grad_accum=2, bs=1, lr=2e-4, cosine 스케줄을 사용했으며 gradient_checkpointing과 expandable_segments를 활성화해 24GB VRAM에서 학습이 가능하도록 조정했다.
- 실행·배포 면에서 PEFT(PeftModel) 형식과 GGUF LoRA 파일을 모두 제공해 Transformers+BitsAndBytes 환경과 llama.cpp 계열 런타임에서 각각 LoRA를 적용한 추론을 지원한다.
- 실험적 제약으로 max_length를 1024로 제한했으며 README에 OOM 회피를 위해 prepare_model_for_kbit_training을 건너뛰는 등 실전 운영에서의 메모리 트릭을 기록했다.
차별점
- Fable-5 agent traces(도구 호출 중심 데이터)를 학습 데이터로 사용해 에이전트 행동·도구 사용에 특화된 파인튜닝임
- Qwen3.6-27B 기반에 QLoRA(4-bit NF4)로 LoRA 어댑터만 학습한 실험적 프로토타입으로, 단일 RTX 4090에서 학습을 완료한 점
- LoRA 타깃을 q/k/v/o/gate/up/down_proj로 상세히 지정해 Attention 및 출력 투영 계층에 직접적인 적응을 시도한 점
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Final Loss | loss | 0.2387 | — |
| Accuracy | accuracy | 97.2% | — |
70
Likes
452
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.