본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

ISTA-DASLab/Qwen3.8-27B-GSQ-RCO-GGUF

텍스트 생성 및 멀티모달 텍스트 생성27Bapache-2.0

GSQ와 RCO로 텐서별 정밀도를 배분한 Qwen3.8-27B GGUF

학습 방식 · Qwen3.8-27B 기반 post-training quantization으로 GSQ가 텐서별 저비트 양자화 변형을 만들고 RCO가 전체 크기 예산에 맞춰 유형을 배정합니다.

TL;DR

이 모델은 Qwen3.8-27B를 기반으로 GSQ와 RCO를 결합한 비균일 mixed-precision GGUF 양자화 모델입니다. GSQ가 텐서별 저비트 scalar 양자화 품질을 높이고, RCO가 전체 파일 크기 예산에 맞춰 각 텐서의 양자화 유형을 따로 선택합니다. IQ3_XXS는 3.00 bpw와 10.1GB에서 AIME25 100.00을 유지하며 BF16 기준 GPQA-Diamond와 LiveCodeBench v6도 약 1점 이내입니다. 표준 GGUF 형식으로 `llama.cpp`, Ollama, LM Studio에서 실행할 수 있고 BF16 vision projector를 함께 사용하면 멀티모달 입력도 처리합니다.

핵심 포인트

  • GSQ가 각 텐서의 좌표별 grid와 group scale을 함께 학습해 2~3비트 scalar 양자화 손실을 줄입니다.
  • RCO가 크기 예산을 정확히 지키면서 gradient 기반으로 텐서별 양자화 유형을 배정합니다.
  • IQ3_XXS는 10.1GB에서 AIME25 100.00, GPQA-Diamond 88.89를 기록해 BF16에 근접합니다.
  • 8.4GB로 같은 크기의 UD-IQ2_S보다 AIME25 10.00점 높은 성능을 냅니다.

제한사항

  • IQ2_XS는 2.50 bpw에서 AIME25 96.67, GPQA-Diamond 84.85, LiveCodeBench v6 76.57로 고품질 변형보다 추론·코딩 점수가 낮습니다.
  • 멀티모달 사용에는 별도 `mmproj-Qwen3.8-27B-BF16.gguf` 파일이 필요하며, vision encoder와 projector는 BF16으로 유지됩니다.
  • 양자화 유형을 텐서마다 다르게 배정하므로 파일별 평균 bit-width와 품질 사이의 선택이 필요합니다.

벤치마크

벤치마크지표비교
Task averagemean of AIME25, GPQA-Diamond, LiveCodeBench v691.87BF16 기준값; GSQ-RCO IQ2_XS 86.03, IQ2_S 89.55, IQ3_XXS 91.15
AIME25score100.00BF16 기준값과 동일; IQ3_XXS 3.00 bpw 및 IQ2_S 2.75 bpw에서 기록
GPQA-Diamondscore88.89기반 BF16 89.90 대비 1.01점 낮음; GSQ-RCO IQ3_XXS 측정치
LiveCodeBench v6score84.57기반 BF16 85.71 대비 1.14점 낮음; GSQ-RCO IQ3_XXS 측정치
Zero-shot averageaverage score75.70BF16 74.34보다 1.36점 높음; GSQ-RCO IQ2_S 측정치
Recoveryrelative to BF16101.8%BF16 대비 GSQ-RCO IQ2_S의 zero-shot 평균 회복률

이미지 분석

평균 bit-width에 따른 AIME25·GPQA-Diamond·LiveCodeBench v6 평균 점수를 GSQ-RCO와 Unsloth UD로 비교한 선 그래프입니다.
GSQ-RCO 점수는 IQ2_XS 2.50 bpw의 약 86.0에서 IQ2_S 2.75 bpw의 약 89.6, IQ3_XXS 3.00 bpw의 약 91.1로 상승합니다. BF16 기준선 91.87에 가까워지는 반면, 비슷한 2.5~2.9 bpw의 UD 점수는 약 78.3과 89.7로 배치되어 텐서별 정밀도 배분의 차이를 읽을 수 있습니다.
평균 bit-width별 AIME25 점수에서 GSQ-RCO와 Unsloth UD 변형을 BF16 기준선 100.00과 비교한 그래프입니다.
GSQ-RCO IQ2_XS는 2.50 bpw에서 96.67을 기록하지만 IQ2_S 2.75 bpw와 IQ3_XXS 3.00 bpw는 모두 100.00에 도달합니다. UD-IQ2_S는 2.49 bpw에서 86.67로 낮아 같은 파일 크기 구간에서 GSQ-RCO IQ2_XS보다 10.00점 낮습니다.
평균 bit-width에 따른 GPQA-Diamond 점수 변화를 GSQ-RCO, Unsloth UD, BF16 기준선으로 나타낸 그래프입니다.
GSQ-RCO는 2.50 bpw에서 84.85, 2.75 bpw에서 86.36, 3.00 bpw에서 88.89로 점진적으로 올라가며 BF16 89.90에 접근합니다. 같은 8.4GB 수준의 UD-IQ2_S는 76.26으로, GSQ-RCO IQ2_XS보다 8.59점 낮은 위치에 있습니다.
평균 bit-width별 LiveCodeBench v6 점수를 GSQ-RCO와 Unsloth UD 변형 및 BF16 기준선으로 비교한 그래프입니다.
GSQ-RCO 점수는 IQ2_XS 2.50 bpw의 76.57에서 IQ2_S 2.75 bpw의 82.29, IQ3_XXS 3.00 bpw의 84.57로 증가하며 BF16 85.71에 근접합니다. 2.49 bpw의 UD-IQ2_S는 72.00으로, GSQ-RCO IQ2_XS보다 4.57점 낮습니다.

89

LIKES

18.7k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.