nvidia/Qwen3.6-35B-A3B-NVFP4
Model Optimizer로 NVFP4 양자화된 Qwen3.6-35B-A3B 체크포인트로 컨텍스트 262K와 MoE 아키텍처를 유지하며 디스크와 GPU 메모리를 약 3.06배 줄였다.
학습 방식 · 기본적으로 Qwen3.6-35B-A3B를 기반으로 하며 양자화는 포스트트레이닝 절차로 Model Optimizer를 이용해 수행되었다. 캘리브레이션 용도로 cnn_dailymail과 Nemotron-Post-Training-Dataset-v2가 명시되어 있으나 훈련 데이터의 세부 구성과 수집 방법은 비공개로 표기되어 있다. 문서는 평가용 데이터셋 목록과 자동화·휴먼 혼합 라벨링 방식을 제시하지만 전체 학습 파이프라인의 구체적 학습 스케줄과 하이퍼파라미터는 공개하지 않았다.
TL;DR
이 모델은 Qwen3.6-35B-A3B를 기반으로 NVIDIA의 Model Optimizer로 NVFP4 포맷을 적용해 양자화된 추론용 체크포인트이다. 아키텍처는 Mixture-of-Experts와 Hybrid Attention을 결합했으며 전체 파라미터 35B 중 약 3B만 동적으로 활성화되어 장문 추론 효율을 확보하고 최대 컨텍스트 길이를 262144 토큰으로 확장했다. 양자화는 Transformer 블록 내 선형 연산자의 가중치와 활성화에 적용되어 비트 수를 16에서 4로 낮추었고 이로 인해 디스크와 GPU 메모리 요구량이 약 3.06배 감소한 반면 주요 벤치마크에서 BF16 대비 점수 열화는 미미하게 유지되었다. 문서는 vLLM과 NVIDIA 하드웨어 최적화 설정을 권장하며 훈련 데이터의 상세는 비공개로 남아 있어 데이터 편향과 유해성 리스크는 배포 전 추가 검증이 필요하다.
핵심 포인트
- NVFP4 포맷으로 공식적으로 양자화된 체크포인트를 제공한다는 점이 차별화 포인트이다. 문서에 따르면 Model Optimizer v0.44.0으로 변환되어 선형 연산자만을 대상으로 4비트 양자화를 적용함으로써 디스크와 메모리 효율을 크게 개선했다. 이 접근은 양자화 후에도 실무 수준의 성능을 유지하는 것을 목표로 한다.
- MoE 아키텍처와 Hybrid Attention의 조합으로 설계되어 전체 파라미터 대비 활성화 파라미터를 낮추는 방식이 도입되었다는 점이 특징이다. 활성화되는 파라미터가 약 3B에 그쳐 동일 파라미터 대비 연산 효율을 개선하며 복잡한 추론 능력은 유지된다. 이는 표준 dense 모델과 비교했을 때 연산 대비 표현력 측면에서 경쟁 우위를 제공한다.
- 매우 긴 컨텍스트 지원(262K)을 명시하여 장문 문서 처리와 장기 리콜 작업에서 다른 체크포인트와 차별화된다. 긴 컨텍스트를 다루기 위해 KV 캐시와 attention 백엔드 최적화가 권장되며 문서에 구체적 런타임 설정이 제시되어 있다. 이 점은 RAG나 다중 문서 요약과 같은 적용 분야에서 실용적 이점을 제공한다.
- vLLM과의 최적화된 서빙 워크플로와 NVIDIA 하드웨어 특화 권장 설정을 문서화하여 실무 배포에 초점을 맞춘 제공임이 드러난다. 서빙 예시는 attention 백엔드, moe 백엔드, speculative config 등 세부 파라미터를 직접 제어하도록 구성되어 있어 운영 환경에서 튜닝 여지를 넓힌다. 이러한 운영 관점의 가이드는 단순 체크포인트 제공을 넘어 배포 친화성을 높인다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU Pro | score | BF16: 85.6, NVFP4: 85.0 | Baseline: Qwen3.6-35B-A3B |
| GPQA Diamond | score | BF16: 84.9, NVFP4: 84.8 | Baseline: Qwen3.6-35B-A3B |
| τ²-Bench Telecom | score | BF16: 95.5, NVFP4: 94.7 | Baseline: Qwen3.6-35B-A3B |
| SciCode | score | BF16: 40.8, NVFP4: 40.6 | Baseline: Qwen3.6-35B-A3B |
| AIME 2025 | score | BF16: 89.2, NVFP4: 88.8 | Baseline: Qwen3.6-35B-A3B |
| AA-LCR | score | BF16: 62.0, NVFP4: 62.0 | Baseline: Qwen3.6-35B-A3B |
| IFBench | score | BF16: 62.3, NVFP4: 62.8 | Baseline: Qwen3.6-35B-A3B |
| MMMU Pro | score | BF16: 74.1, NVFP4: 74.5 | Baseline: Qwen3.6-35B-A3B |
441
LIKES
7.1M
DOWNLOADS
3 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.