로컬 12B 코딩·에이전트 성능 강화
텍스트 생성 기반의 코딩 보조와 터미널·도구 사용을 포함한 멀티스텝 기술 에이전트 작업을 수행한다.12B16K 컨텍스트apache-2.0
Gemma4-12B v2는 google/gemma-4-12B-it 기반으로 코딩과 멀티스텝 도구 사용 에이전트에 특화한 GGUF 로컬 모델이다.
TL;DR
Gemma4-12B v2는 google/gemma-4-12B-it을 기반으로 코딩과 터미널 도구 사용에 초점을 맞춰 추가 파인튜닝한 로컬 GGUF 모델이다. 모델은 읽기→추론→행동→검증의 멀티스텝 에이전틱 궤적과 distilled CoT를 학습해 tau2-bench telecom 20과제에서 동일 Q8_0 조건 하에 베이스 대비 약 3.5배 향상된 성능(~15% → ~55%)을 기록했다. 다양한 퀀트 빌드(Q3_K_M, Q4_K_M, Q6_K, Q8_0)를 제공해 VRAM 제약 환경에서도 실행 가능하며 Gemma 4의 네이티브 툴 콜을 활용해 llama.cpp 기반 에이전트 워크플로와 직접 연동된다. 그 대가로 광범위한 일반지식 벤치마크(MMLU-Pro)에서는 소폭 성능 하락이 보고되어 전문적 코딩·에이전틱 작업에 집중된 용도로 적합하다.
핵심 역량
- 코드 작성과 테스트 실행을 포함한 코딩 지원 작업을 로컬에서 수행할 수 있다.
- 터미널 명령을 읽고 실행하며 파일·로그를 점검해 문제를 진단하고 수정하는 멀티스텝 루프를 유지할 수 있다.
- Gemma 4의 네이티브 툴 콜 포맷으로 구조화된 도구 호출을 내보내 에이전트 루프와 연동할 수 있다.
- 여러 퀀트 옵션을 통해 8GB급 VRAM 환경에서도 실용적인 추론을 제공해 오프라인 비공개 실행이 가능하다.
강점
- 에이전틱 도메인(tau2-bench telecom)에서 동일 Q8_0 조건 하에 베이스 대비 약 3.5배 향상된 성능을 보였다.
- 다양한 GGUF 퀀트 선택지로 VRAM 제약이 있는 로컬 환경에서도 실행 가능하도록 설계돼 소형 하드웨어에서 실용적이다.
- Gemma 4 네이티브 툴 포맷을 출력해 llama.cpp 기반 파이프라인과 바로 연동되는 에이전트 워크플로를 지원한다.
훈련 방식
google/gemma-4-12B-it를 기반으로 코드·터미널 도구 사용 트랙을 중심으로 추가 파인튜닝을 적용했고, Fable 5의 체인오브생각을 Opus 4.8로 재생성해 distilled CoT와 에이전틱 궤적(read→reason→act→verify)을 학습 과정에 포함시켰다.
알아두면 좋은 것
- tau2-bench telecom 도메인 20개 과제에서 공식 gemma-4-12B-it 대비 약 3.5배 향상된 성능(베이스 ~15% → v2 ~55%)을 보고했다.
- 로컬 실행을 목표로 Q3_K_M, Q4_K_M, Q6_K, Q8_0 등 다양한 GGUF 퀀트 빌드를 제공하며 Q4_K_M을 권장 퀀트로 제시했다.
- Fable 5의 체인오브생각 데이터를 Opus 4.8로 재구성한 distilled CoT를 학습에 활용해 에이전틱·코딩 능력을 강화했다고 밝혔다.
- Gemma4 MTP 초안과 관련해 llama.cpp b9553 빌드에서 검증된 작동 사례를 제시했으며 최신 빌드에서의 로딩 오류 주의를 환기했다.
기술적 특징
- 에이전틱 파인튜닝은 도구 사용 궤적을 중심으로 구성돼 있으며 구체적으로 read→reason→act→verify 순서의 멀티스텝 트레이닝 데이터를 사용해 에이전트가 상태 점검과 반복적 조치를 유지하도록 설계됐다. 이 접근법은 단일 스텝으로 멈추는 행동을 줄이고 문제 해결 루프를 끝까지 수행하게 만든다. 결과적으로 터미널 기반 디버깅·수정 작업에서 성공률이 크게 향상됐다.
- 체인오브생각(chain-of-thought)은 distilled CoT 형태로 포함돼 있어 모델이 내부 사고(think 채널)를 유지한 후 행동을 내놓는 패턴을 학습했다. 작성자는 Fable 5의 원본 추적이 사라진 부분을 Opus 4.8로 재구성해 학습에 사용했으며 이로 인해 복잡한 코딩 추론에서 더 일관된 해결 경로가 생성됐다. CoT가 통과 테스트에 기반해 게이팅된 예시와 함께 학습되었다고 명시됐다.
- 동적 컨텍스트 윈도우 패스가 학습 파이프라인에 도입돼 에이전틱 루프의 'read-before-act' 단계가 긴 시퀀스 내에서 보존되도록 처리됐다. 이 방법은 멀티스텝 작업에서 중요한 이전 상태와 증거를 컨텍스트에 남겨두면서도 모델 입력 최대 길이를 효율적으로 활용한다. 결과적으로 연쇄적 도구 호출 시 맥락 누락을 줄여 신뢰성을 개선했다.
- 운영 측면에서는 여러 수준의 퀀타이즈 빌드를 제공해 하드웨어 제약에 따른 품질·크기 트레이드오프를 명확히 제시했다. 권장되는 Q4_K_M는 중간 지점에서 품질과 메모리 요구량 균형을 이루며 Q3_K_M은 8GB VRAM 환경에서의 실용성을 목표로 한다. 또한 MTP 초안과의 결합 사용을 통해 일부 환경에서 생성 속도 가속을 얻을 수 있음을 보고했다.
차별점
- 에이전틱·터미널 도구 사용 특화 파인튜닝으로 동일 크기 모델 가운데 기술적 도메인(telecom 디버깅 등)에서 성능 이득을 노린 점.
- Opus 4.8로 재구성한 distilled CoT 데이터를 포함해 복잡한 코딩 추론의 연속성을 확보한 점.
- 다양한 GGUF 퀀트 빌드 제공과 llama.cpp 생태계(특히 --jinja 도구 포맷 지원)와의 즉시 연동을 염두에 둔 배포 전략.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| tau2-bench telecom | score | ~15% | — |
| tau2-bench telecom | score | ~55% | vs gemma-4-12B-it: ~15% |
1.3k
Likes
400.2k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.