본문으로 건너뛰기
r/LocalLLaMA조회 1

Unsloth의 Qwen3.5 GGUF 최종 업데이트: iMatrix 및 새로운 동적 알고리즘 적용

Unsloth가 iMatrix 데이터와 개선된 양자화 알고리즘을 적용하여 Qwen3.5 모델들의 KL 발산 오차를 대폭 줄인 최종 GGUF 업데이트를 발표했다.

커뮤니티 반응

사용자들은 Unsloth의 지속적인 최적화 작업에 대해 매우 긍정적인 반응을 보였다. 특히 MoE 모델의 양자화 품질 개선 수치에 주목하며, 대형 모델인 397B 버전의 업로드를 기다리는 분위기이다.

실용적 조언

  • 기존 Qwen3.5 GGUF 사용자는 성능 향상을 위해 최신 버전(Unsloth 배포본)으로 재다운로드할 것
  • LM Studio 사용자는 가이드에 따라 'Thinking' 토글 기능을 활성화하여 모델의 추론 과정을 제어할 수 있음
  • Unsloth 무료 노트북을 활용하여 Qwen3.5 모델을 직접 파인튜닝해볼 수 있음

섹션별 상세

Unsloth는 Qwen3.5 MoE 모델의 최대 KL 발산(Maximum KLD)을 직접적으로 줄이기 위해 양자화 방식을 개선했다. 특히 UD-Q4_K_XL 버전의 경우 파일 크기는 8% 증가했으나 최대 KLD는 51%나 감소하는 성과를 거두었다. 이는 양자화 과정에서 발생하는 극단적인 오차(outliers)를 효과적으로 억제했음을 의미한다.
Qwen3.5-122B-A10B 모델의 크기 대비 KLD 성능을 나타내는 벤치마크 그래프와 업데이트 요약 텍스트이다.
InfographicUnsloth의 양자화 알고리즘이 다른 제공자(Bartowski, mradermacher 등)보다 더 낮은 KLD(오차)를 유지하면서도 효율적인 모델 크기를 달성하고 있음을 시각적으로 보여준다. 하단 텍스트는 iMatrix 적용, 모델 재다운로드 권장 사항 등 핵심 업데이트 내용을 요약하고 있다.
모든 GGUF 파일에 새로운 iMatrix 캘리브레이션 데이터셋이 적용됐다. 이 데이터셋은 채팅, 코딩, 긴 문맥 처리, 도구 호출(tool-calling) 시나리오에 맞춰 수동으로 튜닝되었으며, 이를 통해 실제 사용 환경에서의 추론 품질이 향상될 것으로 기대된다.
하드웨어 호환성과 속도 개선을 위해 BF16 레이어를 F16으로 교체했다. 이는 BF16을 지원하지 않는 기기에서 더 빠른 추론 속도를 제공하기 위한 조치이다. 또한 LM Studio에서 Qwen3.5 모델의 'Thinking' 기능을 토글할 수 있는 지원이 추가되어 사용자 편의성이 증대됐다.

용어 해설

GGUF 포맷(GGUF)
llama.cpp와 같은 로컬 추론 엔진에서 효율적으로 실행되도록 설계된 모델 파일 포맷이다. CPU와 GPU 간의 데이터 전송을 최적화하고 단일 파일로 모델을 배포할 수 있어 로컬 LLM 환경에서 표준으로 사용된다.
KL 발산(KL Divergence)
두 확률 분포 간의 차이를 측정하는 통계적 지표이다. LLM 양자화에서는 원본 모델과 압축된 모델 간의 출력 차이를 측정하며, 이 수치가 낮을수록 양자화로 인한 성능 저하가 적음을 의미한다.
중요도 행렬(iMatrix)
양자화 과정에서 각 가중치가 모델 성능에 미치는 중요도를 계산한 데이터이다. 특정 데이터셋을 통해 가중치의 중요도를 미리 파악함으로써, 중요한 부분은 정밀하게 유지하고 덜 중요한 부분은 더 많이 압축하여 효율을 극대화한다.
전문가 혼합 아키텍처(MoE)
전체 파라미터 중 일부 전문가(Expert) 네트워크만 활성화하여 추론하는 구조이다. Qwen3.5와 같은 대규모 모델에서 연산 효율성을 높이는 핵심 기술이지만, 양자화 시 오차 관리가 까다로운 특성이 있다.

코드 예제

bash
lms get unsloth/qwen3.5-4b

LM Studio에서 Unsloth의 Qwen3.5 모델을 다운로드하는 명령어

언급된 도구

Unsloth추천

LLM 학습 및 양자화 최적화 라이브러리

LM Studio추천

로컬 LLM 실행 및 모델 관리 도구

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 06.수집 2026. 03. 06.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.