Gemma4 12B 코드 특화, 4.5GB 실행 가능
Gemma 4 12B를 기반으로 Composer 2.5의 실제 CoT와 Fable 5의 보정 CoT를 증류해 실행 검증된 Python 솔루션을 출력하도록 미세조정한 GGUF 포맷의 로컬 코딩 모델이다.
TL;DR
이 모델은 Google의 Gemma 4 12B를 기반으로 Composer 2.5의 실제 chain-of-thought와 Fable 5의 보완 CoT를 증류해 Python 알고리즘 문제에서 실행 검증된 코드를 생성하도록 미세조정한 로컬 코딩 모델이다. 모델은 GGUF 포맷의 다중 퀀트를 제공해 Q2_K(약 4.5GB)부터 Q8_0(약 11.8GB)까지 하드웨어 제약에 맞춰 선택할 수 있으며 컨텍스트 길이는 메타데이터 버그 수정으로 256K로 고정되었다. 학습 데이터는 오직 코드 실행을 통해 테스트를 통과한 사례만 포함하므로 생성된 코드의 실행 가능성 측면에서 실사용 가치를 확보했고, 모델이 먼저 사고 흐름을 생성한 뒤 코드를 내놓는 'thinking' 채널을 기본으로 유지해 복잡한 문제에서 단계적 해결 전략을 재현한다. 다만 README는 안전성 보강이 되어 있지 않음을 명시하고 영어 중심 데이터 편향과 프로덕션 가드레일 필요성을 함께 알리고 있다.
핵심 역량
- Python 알고리즘 및 함수 구현에서 중간 추론 단계를 생성해 복잡한 문제에 대해 단계적 해결 전략과 함께 실행 가능한 코드를 산출할 수 있다.
- 로컬 환경에서 GGUF 퀀트 파일을 사용해 제한된 VRAM에서도 모델을 로드하고, llama.cpp나 LM Studio 같은 도구로 즉시 질의·응답 세션을 열어 코드 작성 워크플로를 수행할 수 있다.
- 긴 문맥(최대 256K 토큰)을 지원하므로 대형 코드베이스나 긴 대화 맥락을 유지한 채로 문제의 맥락을 반영한 코드를 생성할 수 있다.
강점
- 매우 가벼운 실행 지문을 제공해 Q2_K 퀀트는 약 4.5GB의 파일 크기로 저사양 GPU나 유니파이드 메모리 환경에서도 로컬 실행이 가능하다는 점이 실사용성 우위로 작용한다.
- 학습 신호로 사용된 데이터는 코드 실행을 통해 정답이 검증된 사례만 보존했으므로 모델이 생성하는 코드의 실행 가능성 측면에서 실질적 검증을 거친 특성이 있다.
- 컨텍스트 길이를 256K로 고정해 긴 코드나 대화 맥락을 유지한 상태에서 문제 해결을 시도할 수 있어 대형 파일이나 복합 세션에서 이점을 가진다.
훈련 방식
base_model: google/gemma-4-12B-it을 기반으로 Composer 2.5의 실제 CoT를 교사로 삼아 통과한 실행 결과만 증류하고, Composer가 실패한 사례는 Fable 5로 재시도해 합성 CoT를 보강하는 방식으로 파인튜닝을 수행했다.
알아두면 좋은 것
- 모델은 Apache-2.0 라이선스를 따르고 GGUF 퀀트 형식으로 다양한 비트레벨 Q2_K에서 Q8_0까지 제공되어 서로 다른 VRAM 환경에서 선택적으로 실행할 수 있도록 설계되었다.
- 컨텍스트 길이는 upstream의 metadata 오류를 수정해 256K로 고정되었고, 모든 GGUF 퀀트는 이 수정된 컨텍스트 길이로 재패치되었다.
- 학습 데이터는 Composer 2.5의 실제 chain-of-thought 트레이스 중 테스트를 통과한 사례와 Fable 5가 Composer에 실패한 케이스를 보완해 생성한 합성 CoT를 결합하여 구성되었다.
- 모델은 기본적으로 `enable_thinking=true` 형태의 생각 채널을 활성화해 학습된 사고 흐름을 출력한 뒤 코드를 생성하도록 설계되어 있으며, 안전성 면에서는 거부 반응이 줄어들어 별도의 프로덕션용 가드레일이 권장된다.
기술적 특징
- 실제 실행으로 검증된 CoT 기반 증류 방식을 채택해 교사의 추론 경로와 함께 모델을 학습시켰다. 구체적으로 Composer 2.5의 모델이 생성한 체인 오브 사고를 교사 신호로 사용하고, 각 사례는 코드가 테스트를 통과했을 때만 학습 데이터로 포함되었다. 이 과정을 통해 모델이 추론 근거를 노출한 뒤 실행 가능한 코드를 내놓도록 유도했다.
- 보완 데이터로 Fable 5를 활용해 Composer가 실패한 문제를 재시도하게 함으로써 학습 데이터의 커버리지를 확장했다. Fable 5가 재도전해 생성한 CoT 역시 실행 검증을 통과한 사례만 채택해 hard-case를 보강하는 역할을 수행했다. 이 이중 교사 구조가 난이도 높은 케이스에서의 성능 회복을 목표로 했다.
- GGUF 형식의 다양한 퀀트 옵션(Q2_K, Q3_K_M, Q4_K_M, Q6_K, Q8_0)을 제공해 메모리와 품질 사이에서 사용자 선택을 허용했다. README는 각 퀀트의 파일 크기와 예상 VRAM별 허용 컨텍스트를 표로 제시해 실무자가 하드웨어에 맞춰 적절한 퀀트를 선택하도록 구성되어 있다. KV 캐시 타입 변경(q4_0 사용 권장)을 통해 컨텍스트를 배가하는 실용적인 팁도 포함되어 있다.
- 모델은 Gemma 계열의 네이티브 '생각 채널'을 유지하도록 설계되었고, `enable_thinking=true` 설정이 기본 템플릿에 포함되어 있다. 이 설정은 모델이 먼저 사고 흐름을 출력한 뒤 코드를 생성하도록 동작을 분리해 학습 당시의 행동 양식을 재현하도록 한다. 샘플링 권장값(temp 1.0, top_p 0.95, top_k 64)과 그리디 모드(temp 0) 선택지를 명시해 생성 제어도 제공한다.
차별점
- 학습 데이터에 테스트를 통과한 코드-추론 쌍만 사용한 점이 특징으로, 단순한 코드 데이터셋보다 실행 가능성 측면에서 엄격한 필터링을 적용했다.
- Composer 2.5의 실제 CoT와 Fable 5의 보완 CoT를 결합한 이중 교사 증류 파이프라인이 난이도 높은 케이스에서의 회복력을 높이도록 설계되었다.
- 여러 비트레벨의 GGUF 퀀트로 동일한 모델을 다양한 VRAM 환경에서 운영할 수 있게 한 점이 로컬 운영성 측면에서 차별화 요소로 작용한다.
2.7k
Likes
726.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.