Gemma-4 12B 기반의 토큰 효율적 compact-reasoning 파인튜닝 모델 Grug 12B
Gemma-4 12B를 QLoRA로 미세조정하고 병합해 추론 토큰을 줄이면서 수학·코드 추론 정확도를 유지하도록 설계된 12B 모델이다.
TL;DR
Grug 12B는 google/gemma-4-12B-it를 기반으로 QLoRA와 LoRA 병합 워크플로로 미세조정한 모델로, verbose한 추론 trace를 짧고 고밀도인 compact trace로 변환해 토큰 효율을 높이는 데 초점을 맞추었다. 학습 파이프라인은 엄격한 최신성 컷오프와 라이선스 필터를 적용해 검증된 reasoning·math·code 데이터로 구성되었고 학습은 4-bit NF4 양자화와 BF16 연산을 결합한 상태에서 completion-only SFT로 수행되었다. 로컬 EOS-only 수학 프록시 평가에서 proxy_accuracy 100.0%와 평균 생성 토큰 68.94를 기록해 토큰 사용량 감소와 답안 보존이라는 목표 방향성을 확인했으나 README에서 평가가 소규모 로컬 테스트임을 명시해 광범위한 일반화와 장기 유도 과제에 대한 위험성을 별도 검증해야 한다.
핵심 역량
- 짧고 밀도 높은 내부 추론 스텝을 생성해 동일한 질문에 대해 기본 모델보다 적은 생성 토큰으로 답안을 도출할 수 있다. 이 과정에서 분기 결정, 불변 조건, 예외 케이스와 최종 답안 점검을 명시적으로 보존하도록 타깃이 설정되어 있다. 실무에서 긴 추론 히스토리를 줄여 토큰 비용과 지연을 낮추는 용도로 활용할 수 있다.
- 수학적 계산과 코드 디버깅 관련된 추론 완성에서 답안 품질을 유지하면서 불필요한 서술을 제거하는 동작을 수행한다. 훈련 데이터에 수학·코드·일반 추론 데이터가 혼합되어 있어 다양한 추론 유형에 대해 응답을 생성하는 능력이 강화되었다. 다만 일부 문제에서는 과도한 압축으로 장기 도출 과정이 필요한 경우 성능 저하 가능성이 존재한다.
- 추론 토큰 효율을 평가할 때 기준 모델과 동일한 디코딩 설정으로 비교하면 토큰 사용량과 생성 길이를 줄이는 경향을 보인다. README에 제시된 소규모 로컬 평가는 평균 생성 토큰과 총 생성 토큰에서 큰 차이를 보고하고 있다. 배포 전에는 자체 벤치마크로 도메인별 트레이드오프를 검증해야 한다.
강점
- 로컬 수학 추론 프록시 평가에서 proxy_accuracy 100.0%를 기록하면서 평균 생성 토큰을 68.94로 줄여 기준 모델 대비 생성 토큰과 평균 길이에서 큰 개선을 보였다. 이 결과는 같은 36개 행의 소규모 평가에서 총 생성 토큰이 2,482로 기준 모델의 8,227 대비 현저히 적음을 의미한다. 짧은 학습 시간(단일 A100에서 약 35분)과 완전 가중치 병합 공개는 빠른 실험과 배포를 가능하게 했다.
훈련 방식
기반 모델은 google/gemma-4-12B-it이며 훈련은 completion-only SFT로 진행되었다. 학습은 QLoRA 워크플로로 LoRA 모듈(rank=16, alpha=32)을 BF16 연산과 4-bit NF4 양자화와 결합해 수행했고, 학습 완료 후 LoRA를 기반 모델 가중치에 병합해 최종 모델로 배포했다. 훈련 데이터는 여러 오픈 라이선스의 reasoning·math·code 관련 검증된 compact trace로 구성되었다.
알아두면 좋은 것
- 데이터 파이프라인은 최신성 컷오프와 라이선스 기반 선별을 적용해 소스의 신뢰도를 관리했다. Run date는 2026-06-30이며 기본 최신성 컷오프는 45일로 설정되어 있어 오래된 자료는 자동 거부되었고, 특정 리스크 소스는 수동 검토로 처리되었다. 최종 훈련 데이터는 여러 오픈 라이선스 저장소에서 취합한 5,740개의 검증된 compact trace로 구성되었다.
- 학습은 completion-only SFT로 수행되었고 QLoRA와 PEFT LoRA를 결합해 학습한 뒤 LoRA를 원래 모델에 병합해 최종 weights를 공개했다. 학습 중에는 4-bit NF4 양자화를 사용하고 계산은 BF16으로 유지했으며 LoRA rank=16, alpha=32, dropout=0.05 같은 하이퍼파라미터가 사용되었다. 전체 학습은 단일 A100에서 약 35분 20초가 소요되었고 최종 eval loss는 0.8895로 기록되었다.
- Compact transform은 대형 모델로부터 verbose trace를 압축하는 자동화 파이프라인을 거쳤고 cyankiwi의 Qwen3.6-35B-A3B-AWQ-4bit 모델과 vLLM 서빙을 활용해 압축율과 정답 보존 여부를 검증했다. 압축 과정에서는 원본 답안 보존, 압축 비율, 결정적 정보 손실 여부를 체크하는 검증이 포함되어 불필요한 정보만 제거되도록 설계되었다. 검증 단계에서 6,144개의 compact raw transform 중 5,740개가 최종 학습에 사용되었고 404개는 거부되었다.
- 한정된 로컬 평가 결과만 제공되어 광범위한 성능 보장은 부족하며 README에서 모델이 실험적임을 명시했다. 저자가 직접 경고한 바와 같이 과도한 압축이 필요한 긴 증명이나 상세 유도 과정에서는 정보 손실 위험이 존재한다. 상용 사용 전에는 출처 라이선스와 합법성, 도메인별 성능을 별도 검증할 것을 권고하고 있다.
기술적 특징
- compact-reasoning 타깃은 verbose한 추론 trace를 짧고 고밀도의 단계로 재구성하는 목표로 설계되었다. 원문에서는 분기 결정, 불변 조건, 엣지케이스, 최종 답안 체크를 명시적으로 보존하도록 목표 레이블을 정의했고, 이로 인해 불필요한 filler 단어와 장황한 설명을 제거해 토큰 효율을 개선했다. 이러한 변환은 downstream 응답 품질을 유지하면서 입력당 토큰 비용을 낮추려는 목적을 달성하도록 데이터 전처리 단계에서 구현되었다.
- 학습 기법은 QLoRA와 PEFT LoRA를 결합하고 4-bit NF4 양자화를 적용한 상태에서 BF16으로 연산을 수행한 점이 핵심적이다. 구체적으로 LoRA는 q_proj, k_proj, v_proj, o_proj, gate_proj, up_proj, down_proj 같은 대상으로 적용되었고 rank=16, alpha=32, dropout=0.05의 하이퍼파라미터가 사용되었다. 이러한 설정은 메모리와 연산 비용을 줄이면서도 원본 가중치의 안정성을 보존하고 학습 후 LoRA 병합으로 표준화된 배포 아티팩트를 확보하게 했다.
- 데이터 파이프라인에서는 최신성 컷오프(기본 45일)와 라이선스 기반 필터링을 적용해 훈련 소스의 품질과 합법성을 관리했다. compact transform 과정은 대형 모델을 서빙하는 vLLM 환경에서 cyankiwi의 Qwen3.6-35B-A3B-AWQ-4bit 모델을 사용해 자동 변환과 압축 검증을 수행했으며, 압축비와 정답 보존을 기준으로 수동 및 자동 검증을 병행했다. 이로 인해 학습 데이터의 압축 품질과 추론에 필요한 정보 보존 사이의 트레이드오프를 체계적으로 통제했다.
- 평가 접근은 소규모의 EOS-only 수학 프록시 평가와 압축 관련 검증 지표에 초점을 맞추었다. README에서 제시된 평가는 proxy_accuracy, 총 생성 토큰, 평균 생성 토큰 등 토큰 효율성과 정답 보존을 동시에 측정하는 지표로 구성되었으며, 이는 모델의 핵심 목표인 토큰 효율화 방향을 빠르게 확인할 수 있게 했다. 다만 이 평가는 로컬 스모크 테스트 성격이 강해 광범위한 일반화에는 한계가 있음을 원문에서 명시했다.
차별점
- 학습 목표가 단순한 정답 성능 향상이 아니라 추론 trace의 길이와 밀도를 직접 줄이는 데 초점이 맞춰져 있다. 이로 인해 모델은 동일한 문제에 대해 더 적은 토큰으로 내부 검증과 최종 답안 점검을 유지하도록 조정되었다. 경쟁 모델들이 주로 출력을 길이로만 평가하는 것과 달리 Grug 12B는 trace 압축과 답안 보존의 균형을 중점에 두었다.
- QLoRA로 빠르게 LoRA를 학습한 뒤 학습 완료 후 LoRA를 기반 모델에 병합해 완전한 weights를 공개한 배포 전략을 채택했다. 이 접근은 실험 단계에서 자원 효율성을 확보하면서 사용자에게는 표준화된 모델 아티팩트를 제공하는 효과가 있다. 또한 병합된 가중치 공개는 별도의 LoRA 적용 런타임을 요구하지 않아 배포 편의성을 높였다.
- 데이터 신선도와 라이선스 필터를 엄격하게 적용한 소스 게이팅과 압축 검증 워크플로를 통합했다. 최신성 컷오프와 허용된 라이선스 목록을 명시해 상업적 이용과 출처 검증 위험을 낮추는 방향으로 데이터 준비를 구성했다. 또한 compact transform의 자동적·수동적 검증을 통해 압축 과정에서 핵심 정보가 유실되지 않도록 관리한 점이 차별화 요소이다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Local 36-row math reasoning eval | proxy_accuracy | 100.0% | vs google/gemma-4-12B-it base: 91.7% proxy_accuracy |
| Local 36-row math reasoning eval | total_generated_tokens | 2482 | vs google/gemma-4-12B-it base: 8227 total_generated_tokens |
| Local 36-row math reasoning eval | avg_generated_tokens | 68.9444 | vs google/gemma-4-12B-it base: 228.53 avg_generated_tokens |
56
Likes
890
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.