Qwen3.6 기반 LoRA로 토큰 사용 10~200배 절감한 grug-27b
grug-27b는 Qwen3.6-27B를 기반으로 r=32 LoRA와 think-only 손실을 적용해 내부 사고 토큰을 대폭 줄이면서도 코드·수학·툴 호출 성능을 유지한 토큰 효율형 생성 모델이다.
TL;DR
grug-27b는 Qwen3.6-27B를 기반으로 r=32 LoRA와 think-only loss를 적용하여 내부 사고 토큰을 수십에서 수백 배 줄이면서도 코드·수학·툴 호출 성능을 유지한 모델이다. 학습은 에이전트 궤적과 고품질 gpt-5.5 계열 데이터를 혼합하고 난이도 적응형 사고 길이를 도입하여 쉬운 작업에서는 짧게, 어려운 작업에서는 충분히 깊게 사고하도록 설계되었다. 배포 측면에서는 bf16 병합 가중치와 vLLM/OpenAI 호환 엔드포인트 설정을 제공하며 A100-80GB에서 262k 토큰 처리 사례와 Q4용 QAT 가중치를 별도 제공해 다양한 운영 환경을 지원한다. 실험 결과 HumanEval 등 주요 벤치마크에서 동등하거나 개선된 점수를 보였고 툴 호출 정합성에서 큰 폭의 개선이 관찰되어 에이전트형 워크플로 비용과 안정성을 동시에 개선하는 트레이드오프 특성이 확인됐다.
핵심 역량
- grug-27b는 내부 사고 토큰을 극단적으로 축소하면서도 동일한 출력 품질을 유지하는 추론을 수행한다. 이로 인해 긴 멀티턴 에이전트 세션이나 툴 사용 시 전체 토큰 비용을 크게 줄일 수 있다. 내부적으로는 생각 길이를 입력 난이도에 따라 적응적으로 조절하는 메커니즘을 적용했다.
- grug-27b는 툴 호출 파이프라인과의 호환성을 갖추어 표준 OpenAI 툴 형식으로 tool_calls를 주고받을 수 있다. 모델은 툴 호출 형식의 응답을 스키마 검증 가능한 방식으로 반환하여 에이전트 프레임워크 통합 시 도구 결과의 유효성을 확보한다. README에는 qwen3_coder 파서를 통한 XML 스타일 툴 호출 처리 방식이 기술되어 있다.
- grug-27b는 코드 생성과 수학적 추론에서 높은 정밀도를 보이며 HumanEval, MBPP, GSM8K 등에서 높은 점수를 기록했다. 제시된 벤치마크에서 base와 동등하거나 개선된 성능을 보이는 반면 생각 토큰 사용량은 수십~수백 배 단위로 절감되었다. 이러한 특성은 리소스 제약 환경에서의 배포 효율을 개선한다.
- grug-27b는 Transformers, vLLM, sglang, llama.cpp(gguf) 등 다양한 런타임에서 실행 가능하도록 배포 호환성을 확보했다. README에는 vllm 서빙 예시와 엔드포인트 커맨드 지침이 포함되어 있어 실무 배포가 용이하다. 또한 bf16, Q4/QAT 등 다양한 정밀도 옵션을 지원하는 가중치가 제공된다.
강점
- 토큰 사용량 측면에서 대규모 단위의 절감이 입증되었다는 점이 핵심 강점이다. HumanEval 등에서 동일한 출력 품질을 유지하면서 생각 토큰이 수십~수백 배 줄어든 사례가 제시되어 실사용 비용 절감 효과가 확인됐다. 이로 인해 긴 멀티턴 에이전트나 툴 기반 워크플로에서 운영 효율이 크게 개선된다.
- 툴 호출 시 참조 정합성(reference match)에서 큰 개선이 관찰되었다는 점이 실용적 우위로 작용한다. README의 SWE agentic replay 결과에서 참조 매치 92.6%는 베이스의 54.4% 대비 현저히 높은 수치로 나타났다. 이 수치는 에이전트형 워크플로에서의 신뢰성 확보에 직접적으로 연결된다.
- 배포 호환성과 다양한 정밀도 옵션을 제공한다는 점이 실무 적용성을 높였다. vLLM, Transformers, sglang, llama.cpp(gguf) 등을 통한 실행 경로를 문서화했고 QAT 기반 Q4 가중치도 별도 제공되어 다양한 하드웨어·정밀도 요구를 충족한다.
훈련 방식
기반 모델은 Qwen3.6-27B이며 모든 텍스트 선형층에 r=32 LoRA를 적용한 뒤 bf16로 병합하여 배포했다. 학습 신호는 에이전트 궤적에 대해 think-only loss를 사용하고 신선한 고품질 데이터에는 전체 손실을 적용하는 하이브리드 전략을 채택했다. 추가로 긴 에이전트 세션을 포함한 대규모 궤적과 gpt-5.5 계열의 고난도 데이터로 미세조정을 거쳐 난이도 적응형 사고 길이와 루프 회피 성능을 확보했다.
알아두면 좋은 것
- 라이선스는 Apache-2.0이므로 상업적 사용과 재배포가 허용되는 조건 하에 공개 배포가 가능하다. 베이스 모델로 Qwen/Qwen3.6-27B를 사용했고 LoRA를 병합한 bf16 가중치를 제공한다. 데이터 출처로는 ProCreations의 grug-think 시리즈와 고품질 gpt-5.5 세트가 명시되어 있다.
- grug-27b는 r=32 LoRA를 텍스트 스택의 모든 선형층에 적용한 뒤 bf16로 병합하여 배포했다. 학습 목표로는 think-only loss와 전체 손실을 병행하여 내부 사고의 불필요한 복제를 억제하면서도 신선한 고품질 데이터에 대해 완전한 손실을 적용했다. 이 조합이 모델의 토큰 효율과 출력 품질을 동시에 확보한 핵심 요소로 제시되어 있다.
- 배포와 추론을 위해 vLLM 기반의 OpenAI 호환 컨테이너 구성과 엔드포인트 커맨드 예시가 제공되었다. README는 streaming과 tool calling을 전제로 한 설정 필수 항목과 reasoning parser 설정을 구체적으로 기술하고 있다. 또한 A100-80GB 한 대로 262k 컨텍스트를 처리한 사례가 언급되어 긴 에이전트 프롬프트 환경을 고려한 실무 지침을 포함한다.
- Q4 사용자용으로 QAT에 특화된 gguf 가중치를 별도로 제공하여 4비트 환경에서의 품질 저하를 완화하는 대안을 준비했다. 기본 배포는 bf16과 다양한 Q정밀도(Q8/Q6/Q5)를 염두에 둔 가중치로 지원되며 Q4 전용 가중치는 grug-27b-qat-q4-gguf로 별도 명시되어 있다. 이 점은 경량화된 환경에서 성능 확보를 위해 설계된 운영 선택지를 보여준다.
기술적 특징
- 모델은 Qwen3.6-27B를 기반으로 r=32 LoRA를 텍스트 스택의 모든 선형층에 적용한 뒤 bf16로 병합하여 배포했다. 이 방식은 파라미터 업데이트 부담을 줄이면서도 원본 베이스의 추론 품질을 유지하도록 설계되었다. 병합된 bf16 가중치는 표준 런타임에서 바로 사용 가능한 형태로 제공되었다.
- 학습 신호로는 think-only loss와 전체 손실을 병행하는 전략이 적용되었다. 에이전트 궤적의 'think' 부분에 특화된 손실을 주어 불필요한 사고 표현의 반복 복제를 억제했고, 신선한 고품질 데이터에는 전체 손실을 적용하여 출력 품질을 보존했다. 이러한 손실 분리로 모델이 필요할 때만 깊이 있는 사고를 수행하도록 행동 패턴을 조정했다.
- 난이도 적응형 사고 길이(adaptive depth)를 도입하여 쉬운 작업은 짧게, 어려운 작업은 충분히 길게 내부 사고를 유지하는 정책을 적용했다. v2.1 업데이트에서는 어려운 문제에 대해 더 깊은 사고를 허용하되 전체 토큰 사용량은 베이스 대비 10~30배 적게 유지하는 것을 목표로 했다. 이 메커니즘은 실전 에이전트 대화에서 불필요한 토큰 낭비를 줄이면서도 복원 가능한 해결 과정을 생성하도록 설계되었다.
- 반복성 스트레스 테스트(43개의 greedy gauntlet)를 통해 무한 루프나 반복 중독 문제를 검증했다. 결과적으로 반복성 루프는 0%로 보고되었고 think 블록 닫힘은 100%로 유지되어 반복성 문제를 실험적으로 배제했다. 이 검증 절차는 에이전트형 작업에서의 안정성 확보를 위한 중요한 공정이었다.
- 추론과 배포 측면에서는 reasoning-parser, qwen3_coder와 같은 파서 지원 및 OpenAI 호환 스트리밍/툴 호출 기능을 문서화했다. 또한 A100-80GB 환경에서 fp8 KV-cache를 활용해 262k 토큰 처리 사례를 보고하여 초장문 세션을 위한 런타임 최적화를 제시했다. 이러한 런타임 대비는 에이전트 프레임워크와의 통합을 용이하게 한다.
차별점
- LoRA r=32를 전 텍스트 선형층에 적용하고 병합한 배포 아티팩트로 토큰 절감과 배포 편의성을 동시에 확보했다.
- think-only loss 전략을 통해 내부 사고의 불필요한 복제를 억제하면서 신선한 고품질 데이터에 대해서는 전체 손실을 적용하여 출력 품질을 유지했다.
- 난이도 적응형 사고 길이와 반복성 스트레스 테스트를 결합하여 복잡한 문제에서는 충분히 깊게 사고하고 쉬운 문제에서는 극단적으로 짧게 사고함으로써 실제 비용 대비 성능을 최적화했다.
- Q4 환경을 위한 QAT 기반 gguf 가중치를 별도 제공하여 4비트 실행 시 품질 저하를 줄이는 운영 선택지를 제공했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| HumanEval | pass@1 | 87.2 | v2.1 수치; 동일 하니스에서 비교된 값이다 |
| MBPP sanitized | pass@1 | 85.0 | v2.1 수치; base(77.0) 대비 증가 |
| GSM8K | exact | 95.5 | v1/v2.1 공통 수치, base 대비 개선 |
| MATH-500 | score | 68.7 | v2.1 수치; base@12k 예시(63.3) 대비 개선 |
| SWE agentic replay (tool match) | match % | 92.6 | base=54.4 대비 큰 폭 개선 |
| Token spend reduction (HumanEval think) | token cut | -96% | 같은 하니스에서의 비교 수치 |
78
Likes
1.2k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.