본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

unsloth/Qwen3.6-35B-A3B-NVFP4-Fast

이미지 입력과 텍스트를 결합해 텍스트 응답을 생성하는 vision-language(image-text-to-text) 태스크에 최적화되어 있으며 멀티모달 질의응답, 문서·이미지 이해, 코드 관련 멀티모달 생성 작업을 포함한다.35B total, 3B activated262K 컨텍스트apache-2.0

Unsloth가 Qwen3.6-35B-A3B 기반으로 NVFP4 양자화와 MTP 모듈을 적용해 32GB VRAM에서 작동하도록 조정한 고효율 이미지-텍스트-투-텍스트 추론 체크포인트이다.

학습 방식 · Qwen3.6-35B-A3B 기반에서 사전학습 및 post-training을 거친 후 Unsloth 데이터셋과 UltraChat 데이터셋을 사용해 NVFP4 양자화 보정과 MTP 관련 추가 튜닝을 진행한 체크포인트이다.

TL;DR

Unsloth가 Qwen3.6-35B-A3B 기반 체크포인트를 NVFP4 양자화로 보정하고 MTP 모듈을 포함해 32GB VRAM 환경에서 동작하도록 최적화한 모델이며, README의 실험에서 동일 NVFP4 계열 대비 처리량이 최대 1.79배 향상된 것으로 보고되었다. 모델은 MoE 기반의 아키텍처와 Gated DeltaNet/Gated Attention 블록을 사용해 멀티모달 이해와 긴 컨텍스트 처리 능력을 제공하며 RealWorldQA, OmniDocBench, MMLU-Pro 등 여러 벤치에서 경쟁력 있는 정확도를 보였다. 서빙은 vLLM, SGLang, cute-DSL/trtllm 조합을 권장하며 잘못된 백엔드 선택 시 성능이 크게 저하될 수 있다는 운영상의 주의사항이 명시되어 있다. 따라서 NVFP4 보정과 런타임 최적화를 통해 비용·처리량·정확도의 균형을 맞춘 멀티모달 배포 시 명확한 장점이 있다.

핵심 포인트

  • Unsloth NVFP4 Fast는 동일 NVFP4 계열 중에서도 보정된 체크포인트와 런타임 최적화를 통해 처리량을 우선으로 설계되어 35B-A3B 구성에서 README가 보고한 수치로 1.79배 높은 스루풋을 달성했다. 이 우위는 양자화 알고리즘의 보정 절차와 특정 추론 백엔드(cute-DSL, trtllm 등) 조합에서 나타난 실측 결과에 기반한다. 따라서 동일 모델 크기와 양자화 형식 하에서 높은 처리량이 필요한 배포에 차별점을 제공한다.
  • 모델은 MoE 구조와 Gated DeltaNet/Gated Attention 블록 조합을 사용해 내부 연산 경로를 세분화하고, 각기 다른 헤드·차원 구성을 통해 시각-언어 및 텍스트 추론에 특화된 연산을 수행하도록 설계되었다. 이 구조적 선택은 멀티모달 이해와 STEM·추론 벤치에서의 성능 경쟁력을 뒷받침한다. 문서에서 제시된 레이어 구성과 헤드 차원은 이 설계의 구체적 근거를 제공한다.
  • 서빙 관점에서 vLLM, SGLang, cute-DSL/CUTLASS/flashinfer_trtllm 등 특정 런타임과의 조합을 권장하며, 잘못된 백엔드 선택(예: Marlin) 시 성능이 크게 저하된다는 실험적 근거를 README가 명시하고 있다. 이 점은 단순 모델 성능뿐 아니라 전체 추론 스택의 선택이 실사용 처리량에 결정적 영향을 미친다는 실무적 사실을 보여준다. 따라서 사용자는 모델 선택뿐 아니라 추론 엔진 및 하드웨어 설정까지 염두에 둬야 한다.
  • NVFP4 Fast 체크포인트는 동일 계열 NVFP4 양자화 대비 높은 처리량을 보이며 35B-A3B 구성에서 README의 벤치마크는 1.79배 처리량 개선을 보고하고 있다. 이 개선은 토큰 처리량 수치와 end-to-end thr out 수치에 근거한다. 따라서 비용 민감한 대규모 추론 환경에서 유리한 선택지가 된다.

벤치마크

벤치마크지표비교
NVFP4 Throughput (35B-A3B)throughput11,628 (Unsloth NVFP4 Fast)vs NVIDIA: 6,481 (reported in README throughput chart); 1.79x faster
MMLU-Proaccuracy85.85 (Unsloth NVFP4)vs FP8 85.75; vs NVIDIA NVFP4 85.60
GPQAaccuracy86.74 (Unsloth NVFP4)vs NVIDIA NVFP4 87.12; vs BF16 86.36
AIME 2025accuracy92.29 (Unsloth NVFP4)vs FP8 93.12; vs NVIDIA NVFP4 91.88

이미지 분석

모델 간 다양한 벤치마크(코딩 에이전트, 일반 에이전트, 지식, 멀티모달 등)의 점수를 표 형태로 시각화한 비교 그래프이다.
이 이미지는 Qwen3.6-35B-A3B가 여러 내부·외부 벤치에서 Qwen3.5 시리즈 및 일부 경쟁 모델들과 비교해 전반적으로 높은 점수를 기록한 항목들을 보여준다. 표는 SWE-bench, QwenWebBench, MMLU-Pro, RealWorldQA 등 다수 벤치의 점수를 열로 정렬하여 모델 간 상대 성능과 강점 영역을 한눈에 파악할 수 있게 해준다. 이미지의 수치들이 README의 표와 직접 대응하므로 벤치마크 비교 근거로 활용할 수 있다.
Unsloth NVFP4 Fast 체크포인트와 경쟁 NVFP4/NVIDIA 구현의 토큰 처리량을 바 차트로 비교한 그래픽이다.
이 이미지에서는 27B와 35B-A3B 두 구성에서 Unsloth 구현(일반 및 Fast)이 NVIDIA 구현 대비 토큰 처리량이 크게 높게 측정된 점을 수치로 보여준다. 특히 35B-A3B Fast 변형은 11,628이라는 수치를 표시하며 같은 열의 NVIDIA 대비 약 1.79배 빠른 수치를 제공한다고 표기해 성능 우위를 시각적으로 확인할 수 있다. 이 그래프는 README 내 vLLM 및 cute-DSL/trtllm 백엔드 조합에서 얻은 실험 수치와 대응하므로 추론 스택 선택이 성능에 미치는 영향을 판단하는 근거로 활용된다.

80

LIKES

217.4k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.