QUASAR-QAT/Qwen3.8-27B-QUASAR-NVFP4
이미지와 텍스트를 함께 입력받아 텍스트를 생성하는 멀티모달 추론27B256K 컨텍스트
Qwen3.8-27B의 496개 linear layer 전체를 NVFP4로 학습해 19.7GB로 줄인 QUASAR 양자화 모델
학습 방식 · Qwen/Qwen3.8-27B의 동결된 BF16 원본을 teacher로 삼아 QUASAR 기반 loss-aware NVFP4 quantization-aware distillation을 수행했으며, global batch size 32, learning rate 1e-6, 2446 steps, 1 epoch으로 학습했습니다.
TL;DR
이 모델은 Qwen/Qwen3.8-27B를 기반으로 한 4-bit NVFP4 양자화 모델이며, Fine-tuning이 아닌 QUASAR 기반 Quantization-Aware Training(QAT) 체크포인트입니다. 동결된 BF16 원본을 teacher로 삼아 원본의 출력 분포를 학습하고, 496개 전체 linear layer를 W4A4 NVFP4로 처리해 가중치를 양자화 상태에서 직접 학습합니다. 그 결과 모델 크기를 55.6GB에서 19.7GB로 줄이면서 GPQA-Diamond 0.9091, AIME26 1.0000을 기록해 BF16 원본에 가까운 성능을 유지합니다. vLLM에서 변환 없이 실행할 수 있어 NVIDIA Blackwell GPU 기반 추론 환경에 적합합니다.
핵심 포인트
- Qwen3.8-27B 전체 496개 linear layer를 attention·gated delta-net·MLP까지 NVFP4 W4A4로 양자화
- BF16 원본을 동결 teacher로 삼아 출력 분포를 증류하므로 PTQ보다 원본 동작에 가까운 품질 유지
- 모델 크기 55.6GB에서 19.7GB로 감소했으며 GPQA-Diamond 0.9091과 AIME26 1.0000 기록
- vLLM에서 변환 없이 실행되며 NVIDIA Blackwell과 compute capability 10.0 이상 GPU 필요
제한사항
- NVIDIA Blackwell 및 compute capability 10.0 이상에서 제공하는 FP4 지원 GPU가 필요합니다.
- 32GB GPU에서는 최대 컨텍스트 길이를 65536으로 낮춰야 하며, 실행에 vLLM 0.27 이상이 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| GPQA-Diamond | 정확도 | 0.9091 | BF16 원본 0.9141, unsloth NVFP4 0.8939, Inferact NVFP4 0.8763 |
| AIME26 | 정확도 | 1.0000 | BF16 원본 1.0000, unsloth NVFP4 0.9778, Inferact NVFP4 0.9667 |
108
LIKES
18.9k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.