NVFP4로 3.06배 경량화된 Qwen3.6-35B 양자화 체크포인트
Model Optimizer로 NVFP4 양자화된 Qwen3.6-35B-A3B 체크포인트로 컨텍스트 262K와 MoE 아키텍처를 유지하며 디스크와 GPU 메모리를 약 3.06배 줄였다.
TL;DR
이 모델은 Qwen3.6-35B-A3B를 기반으로 NVIDIA의 Model Optimizer로 NVFP4 포맷을 적용해 양자화된 추론용 체크포인트이다. 아키텍처는 Mixture-of-Experts와 Hybrid Attention을 결합했으며 전체 파라미터 35B 중 약 3B만 동적으로 활성화되어 장문 추론 효율을 확보하고 최대 컨텍스트 길이를 262144 토큰으로 확장했다. 양자화는 Transformer 블록 내 선형 연산자의 가중치와 활성화에 적용되어 비트 수를 16에서 4로 낮추었고 이로 인해 디스크와 GPU 메모리 요구량이 약 3.06배 감소한 반면 주요 벤치마크에서 BF16 대비 점수 열화는 미미하게 유지되었다. 문서는 vLLM과 NVIDIA 하드웨어 최적화 설정을 권장하며 훈련 데이터의 상세는 비공개로 남아 있어 데이터 편향과 유해성 리스크는 배포 전 추가 검증이 필요하다.
핵심 역량
- 긴 문맥을 포함한 텍스트 생성과 대화형 응답을 생성할 수 있다. 최대 컨텍스트 길이는 262144 토큰으로 문서 수준의 장문 이해와 장기 기억 유지에 적합하다. 이 능력은 RAG 시스템과 장문 리콜 평가에 유리하게 작동한다.
- MoE 아키텍처 기반으로 동적 전문가 활성화를 통해 입력에 따라 일부 서브네트워크만 연산에 참여시키며 연산 효율을 확보한다. 전체 파라미터는 35B지만 활성화되는 파라미터는 약 3B로 명시되어 있어 연산량과 메모리 사용을 제어한다. 이 구조는 복잡한 추론에서 높은 표현력을 유지하면서도 실행 비용을 낮추는 결과를 낳는다.
- NVFP4 양자화를 적용하여 모델의 가중치와 일부 활성화를 4비트 표현으로 변환한 상태로 추론이 가능하다. 이 양자화는 디스크 및 GPU 메모리 요구량을 약 3.06배 줄이는 효과를 냈으며 vLLM과 결합된 환경에서 추론 지연과 메모리 사용을 개선한다. 양자화는 Transformer 블록 내 선형 연산자에 한정되어 적용되었다.
- vLLM 호환 런타임에서 서빙이 가능하며 attention 백엔드와 MoE 백엔드 설정을 통해 성능 튜닝이 가능하다. 제공된 서빙 명령은 KV 캐시 dtype, attention backend, moe backend 등 런타임 파라미터를 직접 제어하도록 구성되어 있다. 이로 인해 대규모 병렬 추론과 긴 컨텍스트 처리 시 자원 활용을 세밀하게 조정할 수 있다.
강점
- NVFP4 포맷 적용으로 디스크 크기와 GPU 메모리 요구량이 약 3.06배 감소하여 대규모 모델의 배포 비용과 하드웨어 제약을 줄였다. 이 수치는 문서에서 양자화로 인한 비트수 변화를 기반으로 산출되었다. 결과적으로 동일한 GPU 자원으로 더 큰 모델을 운영하거나 동일 모델을 더 적은 메모리로 서빙할 수 있다.
- 양자화된 상태에서도 BF16 대비 성능 저하가 작게 유지되었다. 문서의 벤치마크 표에서 주요 과제들에 대해 BF16과 NVFP4 간 점수 차이가 미미하게 나타났으며 이는 실무 서빙에서 양자화의 실용성을 뒷받침한다. 따라서 NVFP4는 추론 효율 개선과 성능 보존 사이에서 균형점을 제공한다.
훈련 방식
기본적으로 Qwen3.6-35B-A3B를 기반으로 하며 양자화는 포스트트레이닝 절차로 Model Optimizer를 이용해 수행되었다. 캘리브레이션 용도로 cnn_dailymail과 Nemotron-Post-Training-Dataset-v2가 명시되어 있으나 훈련 데이터의 세부 구성과 수집 방법은 비공개로 표기되어 있다. 문서는 평가용 데이터셋 목록과 자동화·휴먼 혼합 라벨링 방식을 제시하지만 전체 학습 파이프라인의 구체적 학습 스케줄과 하이퍼파라미터는 공개하지 않았다.
알아두면 좋은 것
- 모델은 Qwen3.6-35B-A3B의 구조를 기반으로 NVIDIA Model Optimizer v0.44.0을 사용해 NVFP4 포맷으로 양자화된 버전이다. 양자화는 Transformer 블록 내 선형 연산자의 가중치와 활성화에 적용되며 비트수를 16에서 4로 줄였다. 문서에는 이로 인해 디스크 및 GPU 메모리 요구량이 약 3.06배 감소했다고 명시되어 있다.
- 아키텍처는 Mixture-of-Experts와 Hybrid Attention을 결합한 구성으로서 전체 파라미터는 35B이나 동적으로 활성화되는 파라미터는 3B 수준임이 기록되어 있다. 이 설계는 입력에 따라 일부 전문가만 활성화하여 계산 비용을 낮추면서도 복잡한 추론 능력을 유지하도록 고안되었다. MoE와 hybrid attention의 조합은 장문 컨텍스트 처리에 유리한 구조적 선택이다.
- 문서는 vLLM을 권장 추론 엔진으로 제시하며 세부 서빙 명령과 DGX Spark 권장 설정을 포함하고 있다. 제공된 설정은 kv-cache dtype, attention backend, moe backend, speculative config 등 런타임 측면의 세부 조정을 포함한다. 이 항목은 모델을 실무 환경에 배포할 때 성능 및 안정성 검증을 위한 구체적 가이드를 제공한다.
- 평가 파트는 MMLU Pro, GPQA Diamond, τ²-Bench Telecom, SciCode, AIME 2025, AA-LCR, IFBench, MMMU Pro 등을 포함하며 BF16과 NVFP4 두 조건의 점수를 표로 제시하고 있다. 표는 NVFP4 양자화 상태에서도 전반적인 성능 저하가 크지 않음을 보여주며 구체적 수치가 명시되어 있다. 다만 학습 데이터의 상세 내용은 공개되지 않았으며 문서에서 이 점을 별도로 표기하고 있다.
기술적 특징
- Mixture-of-Experts 구조와 Hybrid Attention을 결합하여 설계되었으며 전체 파라미터는 35B이나 실제 추론 시에는 약 3B만 활성화된다. 이 방식은 입력 특성에 따라 일부 전문가만 연산에 참여하도록 하여 연산 효율을 개선한다. 결과적으로 복잡한 추론 능력은 유지하면서도 비용 효율적인 실행이 가능하다.
- Model Optimizer를 사용한 NVFP4 양자화는 Transformer 블록 내 선형 연산자의 가중치와 활성화에만 적용되었다. 이 양자화로 비트 수를 16에서 4로 낮추어 디스크와 GPU 메모리 요구량을 약 3.06배 줄였다. 양자화는 post-training 형태로 적용되어 원본 모델 구조는 유지되며 추론 전용 체크포인트로 배포되었다.
- 컨텍스트 길이를 262144 토큰으로 확장하여 장문 입력과 멀티문서 시나리오에서 문맥 유지 능력을 확장했다. 긴 컨텍스트 처리를 위해 KV 캐시 관리와 attention 백엔드 최적화가 병행되어야 하며 문서에서는 관련 런타임 설정을 권장하고 있다. 이 확장은 RAG 및 장문 리콜 작업에서 직접적인 이점을 제공한다.
- vLLM과의 통합을 전제로 하여 서빙 명령과 런타임 파라미터 예시를 제공하며 attention backend, moe backend, kv-cache dtype 등 세부 설정으로 추론 성능을 조정할 수 있다. 문서에는 DGX Spark 환경을 위한 권장 옵션과 speculative decoding 설정 예시가 포함되어 있어 대규모 추론 환경에 맞춘 튜닝이 가능하다. 이러한 런타임 제어는 병렬 처리와 메모리 활용을 최적화하는 데 기여한다.
차별점
- NVFP4 포맷으로 공식적으로 양자화된 체크포인트를 제공한다는 점이 차별화 포인트이다. 문서에 따르면 Model Optimizer v0.44.0으로 변환되어 선형 연산자만을 대상으로 4비트 양자화를 적용함으로써 디스크와 메모리 효율을 크게 개선했다. 이 접근은 양자화 후에도 실무 수준의 성능을 유지하는 것을 목표로 한다.
- MoE 아키텍처와 Hybrid Attention의 조합으로 설계되어 전체 파라미터 대비 활성화 파라미터를 낮추는 방식이 도입되었다는 점이 특징이다. 활성화되는 파라미터가 약 3B에 그쳐 동일 파라미터 대비 연산 효율을 개선하며 복잡한 추론 능력은 유지된다. 이는 표준 dense 모델과 비교했을 때 연산 대비 표현력 측면에서 경쟁 우위를 제공한다.
- 매우 긴 컨텍스트 지원(262K)을 명시하여 장문 문서 처리와 장기 리콜 작업에서 다른 체크포인트와 차별화된다. 긴 컨텍스트를 다루기 위해 KV 캐시와 attention 백엔드 최적화가 권장되며 문서에 구체적 런타임 설정이 제시되어 있다. 이 점은 RAG나 다중 문서 요약과 같은 적용 분야에서 실용적 이점을 제공한다.
- vLLM과의 최적화된 서빙 워크플로와 NVIDIA 하드웨어 특화 권장 설정을 문서화하여 실무 배포에 초점을 맞춘 제공임이 드러난다. 서빙 예시는 attention 백엔드, moe 백엔드, speculative config 등 세부 파라미터를 직접 제어하도록 구성되어 있어 운영 환경에서 튜닝 여지를 넓힌다. 이러한 운영 관점의 가이드는 단순 체크포인트 제공을 넘어 배포 친화성을 높인다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU Pro | score | BF16: 85.6, NVFP4: 85.0 | Baseline: Qwen3.6-35B-A3B |
| GPQA Diamond | score | BF16: 84.9, NVFP4: 84.8 | Baseline: Qwen3.6-35B-A3B |
| τ²-Bench Telecom | score | BF16: 95.5, NVFP4: 94.7 | Baseline: Qwen3.6-35B-A3B |
| SciCode | score | BF16: 40.8, NVFP4: 40.6 | Baseline: Qwen3.6-35B-A3B |
| AIME 2025 | score | BF16: 89.2, NVFP4: 88.8 | Baseline: Qwen3.6-35B-A3B |
| AA-LCR | score | BF16: 62.0, NVFP4: 62.0 | Baseline: Qwen3.6-35B-A3B |
| IFBench | score | BF16: 62.3, NVFP4: 62.8 | Baseline: Qwen3.6-35B-A3B |
| MMMU Pro | score | BF16: 74.1, NVFP4: 74.5 | Baseline: Qwen3.6-35B-A3B |
441
Likes
7.1M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.