NVFP4 보정과 MTP를 적용해 35B 모델에서 처리량을 1.79배로 끌어올린 Qwen3.6 체크포인트
이미지 입력과 텍스트를 결합해 텍스트 응답을 생성하는 vision-language(image-text-to-text) 태스크에 최적화되어 있으며 멀티모달 질의응답, 문서·이미지 이해, 코드 관련 멀티모달 생성 작업을 포함한다.35B total, 3B activated262K 컨텍스트apache-2.0
Unsloth가 Qwen3.6-35B-A3B 기반으로 NVFP4 양자화와 MTP 모듈을 적용해 32GB VRAM에서 작동하도록 조정한 고효율 이미지-텍스트-투-텍스트 추론 체크포인트이다.
TL;DR
Unsloth가 Qwen3.6-35B-A3B 기반 체크포인트를 NVFP4 양자화로 보정하고 MTP 모듈을 포함해 32GB VRAM 환경에서 동작하도록 최적화한 모델이며, README의 실험에서 동일 NVFP4 계열 대비 처리량이 최대 1.79배 향상된 것으로 보고되었다. 모델은 MoE 기반의 아키텍처와 Gated DeltaNet/Gated Attention 블록을 사용해 멀티모달 이해와 긴 컨텍스트 처리 능력을 제공하며 RealWorldQA, OmniDocBench, MMLU-Pro 등 여러 벤치에서 경쟁력 있는 정확도를 보였다. 서빙은 vLLM, SGLang, cute-DSL/trtllm 조합을 권장하며 잘못된 백엔드 선택 시 성능이 크게 저하될 수 있다는 운영상의 주의사항이 명시되어 있다. 따라서 NVFP4 보정과 런타임 최적화를 통해 비용·처리량·정확도의 균형을 맞춘 멀티모달 배포 시 명확한 장점이 있다.
핵심 역량
- 이미지와 텍스트를 함께 입력받아 문장형 응답을 생성할 수 있으며 VQA와 문서 이해형 태스크에서 높은 정확도를 보인다. README의 벤치마크 표는 RealWorldQA, OmniDocBench, MMMU 등에서 경쟁력 있는 성능을 보고하고 있어 멀티모달 질의응답 파이프라인에 직접 연결할 수 있다. 모델은 긴 문맥을 기본으로 설계되어 대화형 상태 유지나 문서 수준의 문맥 처리가 가능하다.
- NVFP4 양자화를 적용한 Fast 체크포인트는 동일한 양자화 계열 대비 처리량이 높은 추론을 제공한다는 측정값을 갖고 있다. README의 벤치마크는 35B-A3B Fast 변형이 동일 계열 NVIDIA NVFP4 구현보다 높은 토큰 처리량과 스루풋을 보였음을 제시하고 있다. 이 특성은 클라우드 비용과 레이턴시 민감한 실시간 서비스에서 유리하게 작용한다.
- MTP(Multi-Token Prediction)를 포함해 speculative drafting을 지원함으로써 디코딩 단계에서 다수 토큰을 미리 예측하여 지연을 줄이는 옵션을 제공한다. README는 MTP 활성화 시 자체 speculative draft로 동작하지만 일부 경우 처리량이 다소 낮아질 수 있음을 명시한다. 따라서 낮은 레이턴시와 최대 처리량 사이의 트레이드오프를 운영자가 선택할 수 있다.
- 모델은 MoE(Mixture of Experts) 아키텍처를 사용해 입력마다 일부 전문가만 활성화하도록 설계되어, 총 파라미터는 크지만 활성 연산량은 제어된다. README에 따르면 256개의 전문가 중 8개가 라우팅으로 활성화되며 추가로 1개의 공유 전문가가 존재한다. 이 구조는 특정 복잡도 작업에서 표현력을 유지하면서도 추론 시 연산 효율을 확보하는 데 기여한다.
강점
- NVFP4 Fast 체크포인트는 동일 계열 NVFP4 양자화 대비 높은 처리량을 보이며 35B-A3B 구성에서 README의 벤치마크는 1.79배 처리량 개선을 보고하고 있다. 이 개선은 토큰 처리량 수치와 end-to-end thr out 수치에 근거한다. 따라서 비용 민감한 대규모 추론 환경에서 유리한 선택지가 된다.
- 멀티모달 및 긴 문맥 처리 능력이 뛰어나며 RealWorldQA, OmniDocBench, MMMU 등 다양한 VQA·문서 이해 벤치에서 높은 점수를 기록하고 있다. 긴 컨텍스트(262K~1,010K)를 네이티브로 지원해 장문 대화나 문서 단위 작업에서 맥락 유지 효과를 제공한다. 이 점은 멀티스텝 reasoning이나 코드·리포지토리 수준의 작업에서 실무적 이점을 만든다.
- MoE 아키텍처로 표현력을 유지하면서도 라우팅된 일부 전문가만 활성화해 연산을 절감하는 설계를 채택해 복잡한 태스크에서 효율적으로 동작한다. README에 명시된 활성 전문가 수와 전문가 수는 이 설계의 구체적 근거를 제공한다. MoE는 특정 서브태스크에서 성능을 끌어올리되 전체 추론 비용을 관리하는 데 기여한다.
훈련 방식
Qwen3.6-35B-A3B 기반에서 사전학습 및 post-training을 거친 후 Unsloth 데이터셋과 UltraChat 데이터셋을 사용해 NVFP4 양자화 보정과 MTP 관련 추가 튜닝을 진행한 체크포인트이다.
알아두면 좋은 것
- Unsloth NVFP4 Fast 체크포인트는 Unsloth 데이터셋과 UltraChat 데이터셋으로 보정(calibration)되어 있으며 README에 해당 보정 조합이 명시되어 있다. 이 보정은 NVFP4 양자화에서 정확도 저하를 최소화하기 위한 추가 데이터 기반 튜닝 절차임이 확인된다. 결과적으로 NVFP4 Fast는 동일 계열 양자화 중 높은 처리량을 유지하면서도 주요 벤치마크에서 유사한 정확도를 보고하고 있다.
- 서빙 권장은 vLLM, SGLang, KTransformers 같은 추론 엔진 사용이며 README는 특정 백엔드 선택에 따라 처리량 차이가 크다고 명시했다. 예시로 Marlin 백엔드는 특정 경우 2배 느리다고 명시되어 있어 권장 백엔드 사용이 실질 성능에 결정적 영향을 미친다. 또한 DGX 환경에서는 별도의 환경변수와 MOE 전용 백엔드를 설정해야 최적 성능을 낼 수 있다.
- 모델은 기본적으로 262,144 토큰의 컨텍스트 길이를 제공하며 확장 시 최대 1,010,000 토큰까지 확장 가능하다고 README에 적혀 있다. 긴 컨텍스트를 활용해 'thinking preservation'과 같은 장기 문맥 유지 옵션을 지원하므로 대화형·서술형 태스크에서 장문 상태 보존이 가능하다. 다만 README는 OOM 발생 시 컨텍스트를 줄일 것을 권고해 운영상 메모리 제한 고려가 필요함을 밝히고 있다.
- NVFP4 정확도 표에서는 Unsloth NVFP4와 Unsloth NVFP4 Fast가 MMLU-Pro, GPQA, AIME 2025 같은 벤치마크에서 FP8/BF16/NVIDIA NVFP4와 유사한 수준의 점수를 기록한 것으로 보고되어, 양자화로 인한 성능 저하가 크지 않음을 시사한다. README는 상세한 비교표와 블로그 링크를 통해 절차적 근거를 제공하고 있다. 이 점은 양자화 기반 배포에서 정확도와 효율성의 균형을 평가할 때 중요한 참고자료가 된다.
기술적 특징
- 모델은 Mixture of Experts 구조를 핵심 설계로 사용하며 256개의 전문가 중 라우팅으로 8개의 전문가가 활성화되고 1개의 공유 전문가가 존재한다. 이 방식은 전체 파라미터 수를 크게 유지하면서도 입력별로 활성화되는 계산량을 줄여 추론 효율을 확보한다. MoE 라우팅은 복잡한 코드·멀티모달 문제에서 전문화된 연산 경로를 제공하여 특정 작업군에서 성능을 끌어올린다.
- NVFP4 Fast는 Unsloth의 NVFP4 양자화 파이프라인으로 보정(calibration)을 거쳐 만들어졌으며 보정 데이터로 Unsloth 데이터셋과 UltraChat을 사용했다. 이 보정은 4비트 유사부동소수점 표현으로 인한 정확도 손실을 최소화하기 위해 가중치·활성화 분포를 조정하는 절차를 포함한다. 결과적으로 NVFP4 Fast는 동일 계열 다른 NVFP4 구현과 비교해 처리량을 높이면서도 MMLU-Pro, GPQA 등 기준 벤치에서 유사한 정확도를 유지한다.
- MTP(Multi-Token Prediction) 모듈이 포함되어 있어 speculative decoding 전략을 내장하고 있으며 다수의 예비 토큰을 미리 생성해 디코딩 지연을 줄이는 방식으로 동작한다. README에서 제공한 명령어 예시는 vLLM을 통해 MTP를 활성화하는 설정을 보여주며, 활성화 시 처리량과 응답 레이턴시 사이의 트레이드오프가 존재함을 명시한다. 이 모듈은 특히 높은 동시성 환경에서 전체 처리량을 개선하려는 목적에 적합하다.
- 긴 컨텍스트를 네이티브로 지원하도록 모델과 서빙 구성에서 262,144 토큰을 기본값으로 채택했으며, 필요에 따라 최대 1,010,000 토큰까지 확장이 가능하다. README는 긴 컨텍스트를 활용할 때 메모리 요구가 크게 증가할 수 있으므로 최소 128K 이상의 컨텍스트를 권장하되 OOM 발생 시 축소를 권장하는 운영 가이드를 제공한다. 컨텍스트 확장은 장기 추론·사고 보존(Thinking Preservation) 옵션과 결합되어 반복적 개발·추론 시 역사적 추론 상태를 유지할 수 있게 설계되었다.
차별점
- Unsloth NVFP4 Fast는 동일 NVFP4 계열 중에서도 보정된 체크포인트와 런타임 최적화를 통해 처리량을 우선으로 설계되어 35B-A3B 구성에서 README가 보고한 수치로 1.79배 높은 스루풋을 달성했다. 이 우위는 양자화 알고리즘의 보정 절차와 특정 추론 백엔드(cute-DSL, trtllm 등) 조합에서 나타난 실측 결과에 기반한다. 따라서 동일 모델 크기와 양자화 형식 하에서 높은 처리량이 필요한 배포에 차별점을 제공한다.
- 모델은 MoE 구조와 Gated DeltaNet/Gated Attention 블록 조합을 사용해 내부 연산 경로를 세분화하고, 각기 다른 헤드·차원 구성을 통해 시각-언어 및 텍스트 추론에 특화된 연산을 수행하도록 설계되었다. 이 구조적 선택은 멀티모달 이해와 STEM·추론 벤치에서의 성능 경쟁력을 뒷받침한다. 문서에서 제시된 레이어 구성과 헤드 차원은 이 설계의 구체적 근거를 제공한다.
- 서빙 관점에서 vLLM, SGLang, cute-DSL/CUTLASS/flashinfer_trtllm 등 특정 런타임과의 조합을 권장하며, 잘못된 백엔드 선택(예: Marlin) 시 성능이 크게 저하된다는 실험적 근거를 README가 명시하고 있다. 이 점은 단순 모델 성능뿐 아니라 전체 추론 스택의 선택이 실사용 처리량에 결정적 영향을 미친다는 실무적 사실을 보여준다. 따라서 사용자는 모델 선택뿐 아니라 추론 엔진 및 하드웨어 설정까지 염두에 둬야 한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| NVFP4 Throughput (35B-A3B) | throughput | 11,628 (Unsloth NVFP4 Fast) | vs NVIDIA: 6,481 (reported in README throughput chart); 1.79x faster |
| MMLU-Pro | accuracy | 85.85 (Unsloth NVFP4) | vs FP8 85.75; vs NVIDIA NVFP4 85.60 |
| GPQA | accuracy | 86.74 (Unsloth NVFP4) | vs NVIDIA NVFP4 87.12; vs BF16 86.36 |
| AIME 2025 | accuracy | 92.29 (Unsloth NVFP4) | vs FP8 93.12; vs NVIDIA NVFP4 91.88 |
이미지 분석


80
Likes
217.4k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.