본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ProCreations/grug-27b

적은 사고 토큰으로 같은 품질의 추론을 내는 것을 목표로 Qwen3.6-27B를 LoRA 파인튜닝한 에이전틱 텍스트 생성 모델27B262K 컨텍스트apache-2.0

사고 과정 토큰을 최대 98% 줄이면서 정답 품질은 유지한 Qwen3.6-27B 파인튜닝 모델

학습 방식 · Qwen3.6-27B에 LoRA(r=32, 텍스트 스택 전체 선형층)를 적용해 bf16으로 병합했고, 에이전트 궤적과 GPT-5.5로 생성한 고품질 데이터에 사고 과정에만 손실을 부여하는 think-only loss로 학습했다.

TL;DR

grug-27b는 Qwen3.6-27B에 LoRA(r=32, 텍스트 스택 전체 선형층)를 적용해 bf16으로 병합한 모델로, 에이전트 궤적과 GPT-5.5로 생성한 고품질 데이터에서 사고 과정에만 손실을 부여하는 think-only loss로 학습해 장황한 사고 과정을 압축했다. 같은 HumanEval 문제에서 베이스 모델이 6,539토큰을 쓰는 사고를 33토큰으로 줄이면서도 정답 품질은 그대로 유지하며, MBPP·GSM8K·SWE 에이전틱 재현 등에서 베이스보다 오히려 점수가 오른다. 35B 형제 모델에서 나타난 반복 루프 문제를 사고 기록이 유지되는 경우와 매 턴 폐기되는 경우 양쪽으로 학습해 해결했고, 43개 스트레스 테스트 전부에서 반복 루프가 나타나지 않았다. 쉬운 문제는 짧게, 어려운 문제는 깊게 사고하는 적응적 사고 깊이를 익혀 토큰 절약이 단순 삭제가 아니라 필요할 때는 더 깊이 사고하는 방향으로 이뤄졌다.

핵심 포인트

  • 같은 정답 품질을 유지하면서 사고 과정 토큰을 벤치마크별로 최대 98% 줄여 추론 비용을 크게 낮춘다.
  • 쉬운 문제는 짧게, 어려운 문제는 깊게 사고하는 적응적 사고 깊이를 학습해 단순 토큰 절약이 아닌 상황별 조절을 한다.
  • 35B 버전에서 나타난 반복 루프 문제를 사고 기록 유지·폐기 두 시나리오 모두로 학습해 43개 스트레스 테스트에서 무루프를 확인했다.
  • SWE 에이전틱 재현에서 툴 호출 일치율이 베이스보다 38.2%p 높아 실제 에이전트 워크플로에서 안정성이 개선됐다.

제한사항

  • 시스템 프롬프트를 붙이면 베이스 Qwen3.6-27B가 HumanEval 97.6으로 grug(88.4)를 앞서, 쉬운 벤치마크 점수를 8배 토큰 절약과 맞바꾼 셈이라고 저자가 직접 밝혔다.

벤치마크

벤치마크지표비교
MBPP sanitized pass@1pass@184.0베이스 Qwen3.6-27B 77.0 대비 +7.0
GSM8K exactexact match95.5베이스 93.0 대비 +2.5
SWE 에이전틱 재현: 참조 툴 일치율match rate92.6베이스 54.4 대비 +38.2
HumanEval pass@1 사고 토큰think tokens176 tokens베이스 4082 토큰 대비 -96%

78

LIKES

1.2k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.