yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2-GGUF
저사양 로컬 환경에서 코딩·터미널 작업을 수행하는 12B 에이전틱 파인튜닝 모델(llama.cpp GGUF)12Bapache-2.0
4.5GB 메모리로 로컬 구동하며 베이스 대비 에이전틱 툴 사용 성능을 3.5배 끌어올린 12B 코딩 모델
학습 방식 · google/gemma-4-12B-it를 베이스로, 읽기→추론→행동→검증의 멀티스텝 툴 사용 궤적과 테스트 통과를 조건으로 한 코딩 체인오브소트로 파인튜닝했다.
TL;DR
이 모델은 google/gemma-4-12B-it를 베이스로 읽기-추론-행동-검증을 반복하는 멀티스텝 툴 사용 궤적과 테스트 통과를 조건으로 한 코딩 체인오브소트로 파인튜닝한 12B 에이전틱 모델로, 약 4.5GB 메모리만 있으면 로컬에서 돌아간다. tau2-bench telecom(진단→수정→검증 루프)에서 베이스 모델의 약 15%보다 3.5배 높은 약 55%를 기록했는데, 이는 베이스가 막히면 인간에게 넘기고 포기하는 반면 이 모델은 문제를 계속 붙잡고 풀기 때문이라고 설명한다. 코딩·에이전틱에 집중한 대가로 일반 지식(MMLU-Pro)과 고객서비스형 tau2-bench retail에서는 베이스보다 살짝 낮은 점수를 보인다. Gemma 4의 멀티토큰 예측 드래프트를 이용한 추론적 디코딩도 지원해 llama.cpp에서 약 1.2~1.3배 속도를 더 낼 수 있으며, 안전 정렬보다 과업 성능에 집중해 튜닝됐으므로 프로덕션에는 별도 가드레일이 필요하다.
핵심 포인트
- 약 4.5GB 메모리로 로컬에서 돌아가는 코딩·에이전틱 특화 12B 파인튜닝 모델이다.
- 읽기-추론-행동-검증을 반복하는 멀티스텝 툴 사용 데이터를 추가해 베이스 모델의 '한 스텝에서 멈추는' 문제를 개선했다.
- tau2-bench telecom(진단→수정→검증 루프)에서 베이스 대비 약 3.5배 높은 점수를 낸다.
- Gemma 4의 멀티토큰 예측(MTP) 드래프트를 이용한 추론적 디코딩을 지원해 llama.cpp에서 약 1.2~1.3배 속도 향상을 얻을 수 있다.
제한사항
- 코딩·터미널·에이전틱 작업에 특화된 만큼 일반 지식(MMLU-Pro)에서는 베이스 모델보다 약간 낮은 점수를 보인다.
- 안전성 정렬보다 과업 성능에 초점을 맞춰 튜닝했기 때문에 거부 반응이 줄어 프로덕션에는 별도 가드레일이 필요하다.
- 고객서비스형 tau2-bench retail 과업에는 특화돼 있지 않아 베이스 모델보다 낮은 점수를 낸다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| tau2-bench telecom(로컬 자체 평가, Q8_0) | score | 약 55% | 베이스 gemma-4-12B-it 약 15% 대비 3.5배 |
1.3k
LIKES
400.2k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.