nota-ai/Solar-Open2-250B-Nota-NVFP4
텍스트 생성 — 대형 MoE 모델의 4비트 양자화 배포판(NVIDIA Blackwell GPU 전용)250BUpstage Solar License
Nota AI가 Upstage의 Solar Open2 250B를 NVFP4 4비트로 양자화해 무게를 500.6GB에서 153.3GB로 줄이면서 평균 벤치마크 점수를 81.57→81.35로 거의 유지했다.
TL;DR
이 모델은 Nota AI가 자체 MoE 특화 양자화 프레임워크로 Upstage의 Solar Open2 250B를 NVFP4(4비트 float, W4A4) 형식으로 압축한 결과물로, BF16 500.6GB였던 가중치를 153.3GB로 줄이면서도 15개 벤치마크 평균이 81.57에서 81.35로 거의 그대로 유지된다. 핵심은 Nota AI가 자체 제안한 DREAM-MoE·SRA-MoE 두 양자화 알고리즘으로 MoE 라우팅 결정과 전문가 배치를 양자화 과정 내내 정렬해 손실을 최소화한 것이며, MoE 특화 캘리브레이션 데이터셋 구성 기법은 NVIDIA Nemotron 해커톤 전 트랙 1위를 차지했다. NVFP4는 Blackwell 세대(B200/GB200)의 FP4 텐서 코어에서만 동작하므로 이전 세대 GPU에서는 추론할 수 없고, vLLM에 서빙하려면 Upstage의 v0.22.0 전용 포크가 필요하다. 대형 MoE 모델을 Blackwell GPU 한정으로 저비용에 서빙하려는 상황에 적합하다.
핵심 포인트
- DREAM-MoE·SRA-MoE라는 자체 양자화 알고리즘으로 MoE 라우팅 결정을 정렬해 4비트에서도 성능 손실을 최소화했다.
- BF16 500.6GB를 153.3GB로 3.3배 줄이면서 15개 벤치마크 평균 81.57→81.35로 성능을 거의 그대로 유지했다.
- NVFP4는 FP4 텐서 코어를 가진 Blackwell 세대(B200/GB200) GPU에서만 동작해 이전 세대 하드웨어에서는 쓸 수 없다.
제한사항
- NVFP4 실행에는 Blackwell 세대(B200/GB200) GPU가 필수이며 Hopper·Ada·Ampere 등 이전 아키텍처에서는 동작하지 않는다.
- vLLM으로 서빙하려면 표준 배포판이 아닌 Upstage의 전용 포크(v0.22.0-solar-open2)를 설치해야 한다.
- 이 모델로 파생 모델을 만들 경우 모델명에 'Solar' 접두사와 'Built with Solar' 표기를 포함해야 하는 라이선스 조건이 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| 평균 (15개 벤치마크) | score | 81.35 | BF16 원본 81.57 |
| LiveCodeBench (v5–v6) | score | 88.55 | BF16 87.03 |
| GPQA Diamond | score | 85.45 | BF16 86.26 |
174
LIKES
69.3k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.