NVFP4 4-bit float 양자화로 BF16 500.6 GB에서 153.3 GB로 무게를 축소한 MoE
Solar Open2 250B — Nota NVFP4는 BF16 500.6 GB에서 153.3 GB로 가중치 풋프린트를 줄인 NVFP4(W4A4, group_size=16) 4-bit 양자화 모델이다. DREAM-MoE와 SRA-MoE 같은 MoE 특화 양자화 알고리즘을 통해 라우팅 결정을 보존하면서 평균 점수는 BF16 81.57에서 NVFP4 81.35로 거의 동등하게 유지되었다. 이 모델은 compressed-tensors로 패킹되어 vLLM에서 Blackwell GPU로 직접 서빙되도록 설계되었다.
TL;DR
Solar Open2 250B — Nota NVFP4는 Upstage의 Solar-Open2-250B를 기반으로 Nota AI가 개발한 MoE 특화 양자화 프레임워크를 적용해 weights와 activations를 모두 4-bit float(NVFP4, W4A4, group_size=16)로 변환한 모델이다. 이 모델은 compressed-tensors 포맷으로 패킹되어 vLLM에서 직접 로드되고 Blackwell의 FP4 tensor cores에서 실행되도록 설계되었으며 BF16 500.6 GB에서 NVFP4 153.3 GB로 가중치 풋프린트가 축소된 것이 확인됐다. 벤치마크 평균은 BF16 81.57에서 NVFP4 81.35로 거의 동등하게 유지되어 MoE 양자화 시 비용 절감과 실용적 성능 균형을 달성한 것으로 나타났다.
핵심 역량
- 가중치 및 활성화 모두를 4-bit float로 양자화해 메모리 풋프린트를 크게 줄이는 능력이 있다. 구체적으로 BF16 가중치 용량 500.6 GB에서 NVFP4로 153.3 GB로 축소되어 디스크와 GPU 메모리 요구가 감소했다. 이로 인해 대형 MoE 모델을 Blackwell GPU 환경에서 더 작은 클러스터로 서빙할 수 있는 기반이 마련되었다.
- 양자화 후에도 원본 BF16과 거의 동등한 추론 성능을 유지하는 능력이 있다. README의 벤치마크에서 평균 점수는 BF16 81.57% 대비 NVFP4 81.35%로 소폭 감소에 그쳤으며 일부 벤치에서는 NVFP4가 오히려 더 높은 점수를 기록했다(예: IFBench 81.02 vs 80.00, LiveCodeBench 88.55 vs 87.03). 이 결과는 DREAM-MoE와 SRA-MoE 같은 라우팅 보존 알고리즘과 MoE 특화 보정 데이터셋의 적용으로 달성된 성능이다.
- vLLM과의 즉시 호환성을 제공해 서빙 파이프라인에 곧바로 통합되는 장점이 있다. 모델은 compressed-tensors 포맷으로 패킹되어 vLLM에서 직접 로드하고 Blackwell의 FP4 텐서 코어로 연산을 수행하도록 구성되어 있다. 따라서 별도의 변환 작업 없이 vllm serve 명령으로 텐서 병렬 크기만 설정해 서빙을 시작할 수 있는 구조이다.
강점
- 가중치 풋프린트를 크게 줄여 저장 및 서빙 비용을 감소시킨 점이 강점이다. README에 따르면 BF16 가중치 500.6 GB에서 NVFP4로 153.3 GB로 축소되었으며 이는 디스크 I/O와 GPU 메모리 사용량을 동시에 낮춘 결과이다. 대형 MoE 모델을 보다 작은 인프라에서 운영할 수 있는 실용적 이점으로 이어진다.
- 양자화 후에도 전반적인 벤치마크 평균 성능이 BF16과 거의 동등하게 유지된 점이 강점이다. 표에 따르면 평균은 BF16 81.57에서 NVFP4 81.35로 소폭 하락에 그쳤고 일부 벤치(IFBench, LiveCodeBench, AIME 2026(EN))에서는 NVFP4가 더 높은 점수를 기록했다. 이는 MoE 특화 알고리즘과 보정 데이터셋이 양자화로 인한 성능 저하를 효과적으로 억제했음을 의미한다.
- vLLM과의 즉시 서빙 호환성을 제공하여 운영 전환 비용을 낮춘 점이 강점이다. 모델은 compressed-tensors 포맷으로 패킹되어 vLLM의 로더와 FP4 텐서 코어 기반 실행 경로로 직접 연결되며 serve 명령 예시와 logits processor 설정이 제공되었다. 이 구성은 실무에서 NVFP4 모델을 빠르게 배포하고 운영하는 데 유리한 특성으로 나타났다.
훈련 방식
이 릴리스는 원본 Upstage/Solar-Open2-250B를 기반으로 Nota AI의 MoE 특화 양자화 파이프라인을 적용해 생성되었다. 구체적으로 DREAM-MoE와 SRA-MoE 알고리즘을 사용해 양자화 과정에서 라우팅 결정을 보존하고 보정 데이터셋을 통해 양자화 후 라우팅 행동을 정렬하는 방식으로 동작한다. 이러한 절차는 MoE 모델의 라우팅 민감도를 최소화하면서 weights와 activations를 4-bit float로 변환하는 목표를 달성한 것으로 나타났다.
알아두면 좋은 것
- NVFP4는 weights와 activations를 모두 4-bit floating point로 양자화하는 포맷이며 W4A4과 group_size=16을 사용하고 compressed-tensors로 패킹되어 vLLM에서 직접 서빙되도록 제공되었다. 이 포맷은 FP4 tensor cores를 활용하므로 실행에는 NVIDIA Blackwell 아키텍처(B200 / GB200 등)가 필요하다. README는 Blackwell 미지원 아키텍처(Hopper, Ada, Ampere)에서는 NVFP4 실행이 불가능함을 명확히 밝혔다.
- Nota AI는 MoE에 특화된 양자화 프레임워크를 적용했으며 그 구성 요소로 DREAM-MoE와 SRA-MoE 알고리즘을 공개해 라우팅 보존과 라우팅 동작 정렬을 구현했다. 또한 MoE 특화 보정 데이터셋 구축 방식을 통해 NVIDIA Nemotron Hackathon에서 모든 트랙 1위를 달성한 결과를 제시했다. 이 조합은 공격적인 저비트 양자화 환경에서도 MoE의 라우팅 품질을 유지하도록 설계된 방식이다.
- 가중치 풋프린트는 BF16에서 500.6 GB였으나 Nota NVFP4로 패킹하면 153.3 GB로 축소되어 약 3.26배 수준의 용량 절감이 이루어졌다. 벤치마크 평균은 BF16 81.57 대비 NVFP4 81.35로 평균 성능 손실이 극히 작게 나타났다. 일부 벤치에서는 NVFP4가 BF16을 상회하는 결과를 보여 양자화가 항상 성능 저하를 초래하지 않음을 확인했다.
- vLLM 전용 설정과 예시가 README에 포함되어 있어 실제 서빙에 필요한 설치와 serve 명령, 그리고 chat completion 요청 예시(curl)가 제공되었다. 설치 스크립트는 vLLM precompiled wheel을 지정하고 Upstage 포크에서 vLLM을 설치하는 방법을 기술하며 serve 명령은 tensor-parallel-size와 custom logits processor를 연결하는 구성을 포함한다. 이로 인해 실무에서 Blackwell GPU 환경으로 신속히 전환해 추론 서비스를 가동할 수 있는 실행 경로가 마련되었다.
기술적 특징
- NVFP4는 W4A4 구성으로 weights와 activations 모두를 4-bit floating point로 변환하며 group_size=16을 사용해 텐서 패킹을 수행한다. 이 패킹은 compressed-tensors(llm-compressor) 포맷에 저장되어 vLLM이 파일을 직접 매핑해 재구성 없이 추론을 시작할 수 있는 형태로 제공된다. 내부적으로는 Blackwell의 FP4 tensor cores를 사용해 FP4 연산을 수행하도록 설계되어 실행 환경 의존성이 명확하게 규정되었다.
- Nota AI가 제안한 DREAM-MoE와 SRA-MoE 알고리즘은 MoE 라우팅 결정을 양자화 과정에서 보존하는 목적을 가진다. 이 알고리즘들은 라우팅 행동을 정렬하고 양자화된 가중치와 활성화가 전문가 선택 로직에 미치는 영향을 최소화하는 방식으로 동작한다. 그 결과 라우팅 불일치로 인한 성능 저하를 줄여 NVFP4로도 원본에 가까운 추론 성능을 유지할 수 있는 것으로 나타났다.
- MoE 특화 보정 데이터셋 구축 방법을 적용해 양자화 보정 단계의 입력 분포를 MoE 라우팅 특성에 맞게 구성했다. 이 과정은 양자화 전후의 라우팅 결정 차이를 줄이는 방향으로 보정 샘플을 선택하고 활용하는 절차로 이루어졌다. 해당 접근은 NVIDIA Nemotron Hackathon에서 모든 트랙 1위를 달성한 성과로 입증되었다.
차별점
- MoE 아키텍처에 특화된 양자화 파이프라인을 적용해 라우팅 보존을 우선한 점이 차별화 요소이다. DREAM-MoE와 SRA-MoE 알고리즘을 통해 라우팅 일관성을 유지하면서 weights와 activations를 공격적으로 4-bit로 축소하는 절차를 채택했다. 이로 인해 일반적인 양자화 방법으로는 달성하기 어려운 MoE 환경에서의 성능 보존이 가능해졌다.
- 4-bit float 기반 NVFP4 포맷으로 weights와 activations를 동시에 양자화하고 group_size=16으로 패킹해 compressed-tensors 포맷으로 배포하는 실행 경로가 차별화된다. 이 설계는 Blackwell의 FP4 텐서 코어에서 직접 실행되도록 최적화되어 있으며 기존 GPU 아키텍처에서는 실행이 불가능하다는 점이 명확하다. 따라서 NVFP4는 특정 하드웨어를 전제로 한 고효율 서빙 솔루션으로 위치지어졌다.
- vLLM과의 즉시 호환성 및 모델 전용 logits processor와 parser 제공은 운영 관점에서의 차별점이다. README 예시는 vllm serve 명령과 SolarOpen2TemplateLogitsProcessor 연결을 통해 모델 특화 파서를 활성화하는 방법을 보여주며 이는 서빙 정합성을 높이는 구현 방식이다. 결과적으로 개발자가 별도 변환 없이 vLLM 파이프라인으로 통합해 실서비스로 이동할 수 있는 이점이 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Tau2-Bench | score | 75.08 | vs BF16: 75.20 |
| IFBench | score | 81.02 | vs BF16: 80.00 |
| LiveCodeBench (v5–v6) | score | 88.55 | vs BF16: 87.03 |
| MMLU-Pro | score | 86.15 | vs BF16: 86.19 |
| AIME 2026 (EN) | score | 96.67 | vs BF16: 95.67 |
| Avg. | score | 81.35 | vs BF16: 81.57 |
147
Likes
7.8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.