yuxinlu1/gemma-4-12B-agentic-fable5-composer2.5-v2-3.5x-tau2
Gemma4-12B v2는 google/gemma-4-12B-it 기반의 full-precision safetensors 마스터로 coding과 agentic 도구 사용에 초점을 맞춘 파인튜닝 모델이며 tau2-bench telecom에서 동일 조건 대비 약 3.5배 높은 55% 성과를 기록했다.
학습 방식 · v2는 google/gemma-4-12B-it을 기반으로 Composer 2.5와 Fable 5 자가작성 데이터, 그리고 커스텀 코딩·agentic 궤적을 이어붙이는 방식으로 추가 파인튜닝을 진행한 모델이다. 모든 추론 데이터는 distilled CoT 형태로 처리되었고 코딩 태스크의 경우 테스트 통과를 조건으로 한 gated CoT가 적용되었다. Fable 5 원자료 일부가 없을 때는 Opus 4.8(xhigh)로 reasoning traces를 재구성해 보완했다.
TL;DR
이 모델은 google/gemma-4-12B-it을 기반으로 한 full-precision safetensors 마스터로 coding과 agentic 도구 사용에 초점을 맞춘 파인튜닝 버전이다. 핵심 변경점은 multi-step agentic 궤적(read→reason→act→verify)과 distilled Chain-of-Thought 기반의 gated CoT를 도입해 터미널·툴 사용 워크플로우에서 행동의 연속성과 근거 기반 판단을 강화한 점이며, 동일 조건의 tau2-bench telecom에서 약 55%의 성공률을 기록해 base의 약 15%보다 크게 향상되었다. 배포 측면에서는 safetensors 마스터와 다수의 GGUF 양자화 빌드를 함께 제공해 로컬 환경별 최적화가 가능하며 MTP speculative decoding 드래프트를 통해 특정 llama.cpp 빌드에서 생성 속도 개선을 확인했다. 반면 학습 초점의 편향으로 MMLU-Pro와 같은 일반 상식형 벤치마크에서는 base보다 소폭 낮은 결과가 보고되어 범용성·전문성 사이의 트레이드오프가 존재한다.
핵심 포인트
- 이 모델은 agentic 도메인 전용으로 학습 궤적을 설계하여 도구 호출과 검증 루프를 네이티브 Gemma 4 프로토콜로 출력하는 점에서 차별화된다. 이러한 네이티브 프로토콜 출력은 외부 툴과의 통합을 간소화하고 툴-호출 후 검증 단계까지 자동화하는 워크플로우에 적합하다. 결과적으로 터미널 기반 디버깅과 멀티스텝 자동화 작업에서 동급 기종보다 더 실전 지향적인 행동을 보인다.
- full-precision safetensors 마스터를 공개하면서 빌더가 직접 양자화·추가 튜닝을 수행할 수 있게 한 배포 전략이 차별점이다. README에서는 다양한 권장 GGUF 양자화 빌드를 함께 제공해 테스트와 배포 사이의 진입장벽을 낮추었다. 이 접근은 커스터마이제이션과 재현 가능한 로컬 실험을 중시하는 오픈소스 빌더에게 특히 유용하다.
- MTP speculative decoding 드래프트를 공식적으로 포함해 특정 실행 스택(llama.cpp b9553)에서 generation 속도 향상을 입증한 점이 다른 공개 파인튜닝 모델과 구별되는 요소다. 이 기능은 양자화된 GGUF 빌드와 결합했을 때 로컬 환경에서 실용적인 throughput 개선을 가능하게 한다. 다만 드래프트 로더의 빌드 민감성은 함께 고려해야 할 차이점이다.
- v2는 agentic 도구 사용과 터미널 기반 작업에서 동일 조건 대비 약 3.5배(기준: tau2-bench telecom, Q8_0, 로컬 하니스)에 이르는 성능 향상을 보였다. 이 수치는 README의 동일 하니스 비교 테이블에서 v2=55% 대 base≈15%로 제시된 값을 근거로 한다. 따라서 실전적 도구 연동 시 행동 일관성과 문제 해결 능력 측면에서 실용적 우위를 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| tau2-bench telecom | success rate | Gemma4-12B v2: 55% | vs official gemma-4-12B-it (base): ~15% (same-harness, Q8_0, greedy decoding) |
48
LIKES
1.8k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.