NVFP4로 처리량 2.5× 높인 Qwen3.6 27B 양자화 체크포인트
이미지와 텍스트를 함께 입력받아 텍스트 출력을 생성하는 image-text-to-text 멀티모달 태스크와 에이전트형 코딩 및 장문 추론을 포함한 대화형 응답 생성 작업을 수행한다. 모델은 시각 입력을 이해해 코드·문서·질문응답을 생성하거나 편집 지시를 처리하는 데 최적화되어 있다. 장문 컨텍스트를 활용한 리포지토 수준의 reasoning과 툴 호출을 포함한 에이전트 워크플로를 지원하도록 설계되었다.27B262K 컨텍스트apache-2.0
Qwen3.6-27B 기반의 Unsloth NVFP4 양자화 체크포인트로 24GB GPU에서 동작하며 NVFP4 보정과 MTP를 통해 원본 성능을 유지하면서 추론 처리량을 크게 높였다.
TL;DR
Qwen3.6-27B NVFP4는 Qwen3.6 27B 기반의 post-trained 양자화 아티팩트로 Unsloth와 UltraChat 데이터로 보정하여 NVFP4 특유의 저비트 표현으로도 주요 벤치마크 정확도를 유지하도록 설계되었다. 이 체크포인트는 MTP 모듈을 포함해 speculative multi-token 초안 생성으로 디코딩-처리량 트레이드를 런타임에서 조정할 수 있으며, vLLM·cute-DSL·flashinfer 계열 백엔드 조합에서 최대 2.5배 수준의 처리량 향상을 보고했다. 컨텍스트 길이 262,144 토큰을 기본으로 지원하고 24GB VRAM 환경에서 동작하도록 최적화되어 있어 긴 컨텍스트와 멀티모달 에이전트 워크플로에 적용 가능하나, 최종 처리량은 백엔드와 런타임 설정에 크게 좌우된다는 제한이 있다.
핵심 역량
- 이미지와 텍스트를 동시에 받아 상황 설명·질문응답·코드 생성 등 텍스트 결과물을 생성할 수 있다.
- 에이전트형 코딩 워크플로에서 리포지토 단위의 추론과 파일 편집 지시를 처리할 수 있다.
- 확장된 컨텍스트(기본 262,144 토큰)를 활용해 긴 대화나 문서 일괄 처리를 수행할 수 있다.
- MTP 모듈을 통해 speculative draft를 생성하여 디코딩 지연-처리량 트레이드오프를 조정할 수 있다.
강점
- NVFP4 보정을 통해 동급 NVFP4 대비 높은 처리량을 달성하면서 MMLU-Pro 등 주요 벤치마크에서 유사한 정확도를 유지했다고 보고되었다.
- 24GB VRAM 환경에서 작동 가능하도록 양자화와 백엔드 조합을 최적화해 보편적인 GPU에서 배포가 수월하다.
- vLLM·SGLang·cute-DSL/flashinfer 계열 백엔드와의 호환성으로 다양한 추론 환경에서 실무적 성능 튜닝이 가능하다.
훈련 방식
Qwen3.6-27B를 기반으로 사전학습 후 포스트트레이닝·보정(post-training calibration)을 통해 NVFP4 양자화를 적용했으며, 보정 데이터로 Unsloth 내부 데이터와 UltraChat을 혼합해 정밀도 유지와 추론 효율을 동시에 확보했다.
알아두면 좋은 것
- Unsloth가 NVFP4로 재보정한 체크포인트로 다른 NVFP4 대비 2.5배 처리량을 주장하며 24GB VRAM에서 동작하도록 최적화되어 있다.
- vLLM을 권장 서빙 엔진으로 명시하고 cute-DSL / CUTLASS / flashinfer 등 특정 백엔드 조합에서 더 높은 처리량을 보고했다.
- 체크포인트에 MTP 모듈이 포함되어 speculative decoding을 자체적으로 수행할 수 있으며, 이를 통한 처리량·지연 조정 옵션을 제공한다.
- 모델 아티팩트는 Hugging Face Transformers 포맷과 vLLM, SGLang, KTransformers 등 여러 프레임워크와 호환된다.
기술적 특징
- NVFP4 기반 양자화는 가중치를 하드웨어 친화적 저비트 부동소수점 형식으로 변환하고 데이터셋 기반 보정(calibration)을 수행해 정밀도 손실을 최소화하면서 메모리와 연산을 줄인다. 이 보정 과정에는 Unsloth의 자체 데이터와 UltraChat이 사용되었으며, 벤치마크에서 FP8/BF16과 유사한 정확도를 보였다. 결과적으로 24GB GPU에서도 모델을 운영할 수 있게 되어 추론 배포 옵션이 확장되었다.
- MTP(Multi-Token Prediction) 모듈은 모델이 자체적으로 여러 토큰의 초안을 생성하고 이를 후속 검증 단계에서 취사 선택하는 speculative 디코딩 패턴을 제공한다. 이 모듈을 활성화하면 평균 응답 지연을 줄이면서 일부 상황에서 처리량을 희생하는 대신 전체 처리 효율을 개선할 수 있다. README는 MTP 사용 시 throughput과 응답 지연 간의 트레이드오프가 존재함을 명시했다.
- 서빙 측면에서는 vLLM과 cute-DSL/CUTLASS/flashinfer 같은 하드웨어 최적화 백엔드를 권장하여 소프트웨어-하드웨어 협업으로 성능을 끌어올렸다. README는 특정 백엔드 조합에서 marlin 백엔드 대비 2배 느린 결과가 발생한다고 경고하며 적절한 백엔드 선택이 성능에 결정적임을 보여주었다. DGX Spark용 환경 변수와 백엔드 플래그 예시가 제공되어 실전 배포 가이드를 제공한다.
- 아키텍처 측면에서 Qwen3.6의 구조적 특성으로 Gated DeltaNet와 Gated Attention 등 혼합 블록 레이아웃을 사용해 표현력과 계산 효율을 조합했다. 모델은 64개 레이어, 내부 차원과 head 구성에서 고유한 레이아웃을 가지며 이 구조는 대규모 컨텍스트 유지와 멀티모달 입력 처리를 위해 설계되었다. 이러한 내부 구성은 긴 컨텍스트에서의 안정적인 추론과 시각-언어 융합에 기여한다.
차별점
- NVFP4 양자화 아티팩트를 재보정해 다른 NVFP4 구현보다 높은 처리량을 목표로 설계했다.
- MTP 모듈을 포함해 speculative multi-token 초안 생성으로 디코딩 트레이드오프를 런타임에서 조정할 수 있다.
- 24GB VRAM 환경에서 동작 가능한 양자화 설정으로 범용 GPU에서 배포 가능성을 높였다.
- 다수의 고성능 추론 백엔드(vLLM, cute-DSL, flashinfer 등)와 명시적 호환성 지침을 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU-Pro | accuracy | 86.2 | — |
| GPQA Diamond | accuracy | 87.8 | — |
| QwenWebBench (Elo) | elo | 1487 | — |
| Terminal-Bench 2.0 | score | 59.3 | — |
| Claw-Eval (pass^3) | pass^3 | 60.6 | — |
| RealWorldQA | accuracy | 84.1 | — |
이미지 분석


233
Likes
2.1M
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.