본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

unsloth/Qwen3.6-35B-A3B-MTP-GGUF

모달리티 결합 텍스트 생성과 시각-텍스트 응답을 포함하는 image-text-to-text 파이프라인 작업을 수행하며 긴 문맥 유지, 코드 및 에이전트형 도구 호출 지원을 목적으로 설계되었다.35B total, 3B activated262K 컨텍스트apache-2.0

Unsloth가 배포한 Qwen3.6-35B-A3B GGUF는 MTP 기반으로 1.5~2배 추론 가속을 목표로 하는 시각·언어 통합형 대규모 언어모델로, 262,144 토큰 기본 컨텍스트와 MoE 아키텍처를 결합해 멀티모달 추론을 지원한다.

학습 방식 · 기본적으로 대규모 사전학습에 후속 포스트트레이닝을 결합한 형태이며 아키텍처 측면에서 MoE를 포함한 하이브리드 블록(Gated DeltaNet → MoE, Gated Attention → MoE)을 사용해 멀티모달과 에이전트 워크플로에 특화된 능력을 강화했다.

TL;DR

Unsloth가 배포한 Qwen3.6-35B-A3B GGUF 변형은 Gated DeltaNet과 대규모 MoE를 결합한 하이브리드 아키텍처를 기반으로 이미지-텍스트 결합 작업과 에이전트형 워크플로 지원을 목표로 설계되었다. 모델은 기본 262,144 토큰의 긴 문맥을 네이티브로 지원하며 MTP(Multi-Token Prediction)를 적용해 README에서 약 1.5~2배의 추론 가속을 보고하고 있다. 배포 측면에서는 GGUF 양자화와 llama.cpp, SGLang, vLLM 등 주요 서빙 툴과의 호환을 제공하며 Unsloth Studio가 하드웨어별 MTP 설정을 자동화해 실무적 배포 편의성을 높였다. 공개된 벤치마크 표는 코딩 에이전트, VQA, 지식·수리 벤치마크 등에서 경쟁력 있는 점수를 제시해 멀티모달·장기 문맥 작업에서 실용적 선택지를 제공함을 시사한다.

핵심 포인트

  • Unsloth 배포판은 MTP를 기본 전제로 한 GGUF 변형을 제공해 로컬/클라우드 환경 모두에서 추론 처리량을 상향시키는 배포 전략을 채택했다. 이 전략은 양자화된 가중치와 MTP를 결합해 실사용 추론 성능을 최적화하려는 점에서 차별화된다.
  • 아키텍처 수준에서 Gated DeltaNet과 대규모 MoE를 혼합한 하이브리드 블록 레이아웃을 사용해 멀티모달 입력 처리를 위한 표현 분리와 전문가 기반 전문화를 동시에 구현한 점이 구체적 차별점이다.
  • 기본 컨텍스트 길이를 262,144 토큰으로 설계하고 최대 1,010,000 토큰까지 확장 가능하다고 명시해 긴 문맥을 필요로 하는 에이전트·코드·리포지토리 작업에서의 사용성을 강조한 점이 운영적 차별성으로 작용한다.
  • 긴 컨텍스트(262K 토큰 기준)를 네이티브로 지원해 리포지토리 수준의 코드 이해나 장기 대화 유지가 가능하며 README는 확장 컨텍스트 설정도 명시해 초대용량 문맥 처리가 가능함을 나타냈다.

벤치마크

벤치마크지표비교
SWE-bench Verifiedscore73.4
Terminal-Bench 2.0score51.5
QwenWebBench (Elo)Elo1397
MMLU-Proaccuracy85.2
RealWorldQAscore85.3

이미지 분석

다중 카테고리 벤치마크 표를 시각화한 차트로 Qwen3.6-35B-A3B가 SWE-bench, QwenWebBench, MMLU-Pro 등 여러 벤치마크에서 비교 점수를 받는 결과를 보여준다.
이미지는 여러 모델(Qwen3.5, Gemma4 등)과 Qwen3.6-35B-A3B의 카테고리별 점수를 병렬 막대그래프로 제시해 상대적 성능 포지셔닝을 직관적으로 전달한다. 차트 내 수치로 SWE-bench Verified 73.4, QwenWebBench Elo 1397, MMLU-Pro 85.2 같은 주요 점수가 시각적으로 강조되어 있어 모델의 강점(코딩 에이전트·지식·비전 이해)을 빠르게 파악할 수 있다. 벤치마크 표 하단의 주석은 평가 조건(컨텍스트 길이, 온도, 측정 환경)을 명시해 각 수치 해석에 필요한 실험적 전제를 제공한다.
Unsloth Studio의 사용자 인터페이스 스크린샷 GIF로, 모델 선택과 MTP 및 추론 관련 설정이 UI에서 자동 구성되는 과정을 보여준다.
해당 GIF는 Unsloth Studio가 Qwen3.6 GGUF 모델을 불러와 컨텍스트 길이와 KV 캐시 타입, speculative decoding 같은 MTP 관련 옵션을 GUI로 제어하는 모습을 보여주며 MTP 설정 자동화 기능의 존재를 시각적으로 확인시킨다. UI는 사용자가 별도 커맨드 없이 하드웨어에 맞춘 MTP 설정을 적용할 수 있음을 암시하므로 모델 배포와 튜닝 부담을 낮추는 운영상 이점을 전달한다. 이 이미지는 배포·운영 관점의 근거 자료로서 README의 MTP 가속·스튜디오 자동화 주장을 뒷받침한다.

658

LIKES

727.5k

DOWNLOADS

3 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.