nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4
30B MoE의 3B 활성 구조와 NVFP4 양자화로 장문 Reasoning·Coding Agent 배포를 겨냥한 모델
학습 방식 · Nemotron-3.5-Lightning-30B-A3B 기반의 NVFP4 양자화 모델로, 20T 토큰 이상 Pre-training과 MTP Continued Pre-training을 거쳤다. 이후 Code·Math·Science·Tool Calling·Instruction Following 데이터로 SFT하고, GRPO를 활용한 비동기 Multi-environment Reinforcement Learning을 적용했다. 마지막으로 NVIDIA Model Optimizer의 Four Over Six NVFP4 W4A16 PTQ를 Routed·Shared Expert에 적용하고 Mamba Projection과 KV cache에는 FP8 동적 스케일을 사용했다.
TL;DR
NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4는 Nemotron-3.5-Lightning-30B-A3B를 NVFP4로 양자화한 MoE 기반 Reasoning·Chat 모델이다. Mamba-2와 MoE, 선택적 Attention을 결합하고 전체 30B 중 3B만 활성화해 최대 1M 토큰 문맥과 장시간 Agent 작업을 겨냥한다. MTP와 DSpark·DFlash Speculative Decoding으로 여러 토큰을 한 번에 예측하거나 외부 Draft를 활용하며, vLLM·TensorRT-LLM·SGLang에서 NVIDIA GPU 배포를 지원한다. NVFP4 평가에서 SWE-bench Verified 52.80%, IFBench 72.88%, GDPval-AA-V2 865점을 기록했고, BF16 대비 일부 코딩·지시 이행 지표는 높지만 HLE와 AA-LCR은 낮았다.
핵심 포인트
- NVFP4로 저장한 양자화 모델이며 기반은 Nemotron-3.5-Lightning-30B-A3B이다. 전체 30B 파라미터 중 추론마다 3B만 활성화한다. W4A16과 FP8 스케일을 조합해 NVIDIA GPU에서 메모리 부담을 낮춘다.
- Mamba-2, MoE, 선택적 Attention을 교차 배치한 Hybrid 구조다. Mamba-2가 시퀀스 처리를 담당하고 MoE가 입력에 따라 일부 Expert를 선택한다. 전체 파라미터보다 활성 파라미터가 작아 장시간 Agent 작업과 Sub-agent 운용에 맞는다.
- 최대 1M 토큰 입력을 처리하며 MTP와 외부 Drafter를 이용한 Speculative Decoding을 지원한다. DSpark는 한 번의 Forward Pass에서 토큰 블록을 제안하고 DFlash는 Block Diffusion 방식으로 Draft를 생성한다. DGX Spark 저동시성 환경에서는 DSpark를 권장하고 H100 고처리량 환경에서는 별도 설정을 사용한다.
- 20T 토큰 이상 Pre-training 뒤 MTP Continued Pre-training, SFT, GRPO 기반 Reinforcement Learning, NVFP4 PTQ를 순서대로 거쳤다. SFT에는 Code·Math·Science·Tool Calling·Structured Output 데이터가 포함됐다. GRPO 학습은 다단계 Tool Use와 Multi-turn 대화까지 포함해 Reasoning 및 Agent 동작을 겨냥한다.
제한사항
- NVFP4 수치는 NVIDIA가 일관된 NeMo Gym 및 NeMo Evaluator 설정으로 측정한 결과다. 다른 공급자의 Prompt·Parser·Inference 설정을 쓰면 점수가 달라질 수 있다. 실제 Agent 시스템에서는 도구 연결과 업무 데이터에 대한 별도 검증이 필요하다.
- 주요 지원 언어는 English, Spanish, French, German, Italian, Japanese와 Coding languages다. README의 모델 카드 언어 목록에는 Korean이 포함되지 않는다. 비영어권 업무에 적용할 때는 대상 언어별 품질 평가가 필요하다.
- 학습 데이터가 모든 인구집단을 균등하게 대표하지 않는다고 명시돼 있다. 일부 데이터셋에서는 성별·인종 관련 표현의 분포 편향이 확인됐다. 상용 배포 전에는 Bias audit와 사용 도메인별 안전성 검증이 필요하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU Pro | accuracy | 81.62 | 기반 BF16 체크포인트: 81.94, NVFP4 측정값은 기반 대비 -0.32 |
| GPQA Diamond (no tools) | accuracy | 75.57 | 기반 BF16 체크포인트: 75.44, NVFP4 측정값은 기반 대비 +0.13 |
| HLE (text-only, no tools) | accuracy | 10.47 | 기반 BF16 체크포인트: 11.72, NVFP4 측정값은 기반 대비 -1.25 |
| SWE-bench Verified | accuracy | 52.80 | 기반 BF16 체크포인트: 51.56, NVFP4 측정값은 기반 대비 +1.24 |
| Terminal-Bench 2.1 | accuracy | 23.46 | 기반 BF16 체크포인트: 24.58, NVFP4 측정값은 기반 대비 -1.12 |
| IFBench (loose) | accuracy | 72.88 | 기반 BF16 체크포인트: 71.88, NVFP4 측정값은 기반 대비 +1.00 |
| AA-LCR | accuracy | 49.19 | 기반 BF16 체크포인트: 52.00, NVFP4 측정값은 기반 대비 -2.81 |
| GDPval-AA-V2 | score | 865 | 기반 BF16 체크포인트: 832, NVFP4 측정값은 기반 대비 +33 |
| SWE-Bench Verified | score | 52.80% | 제공 이미지의 Agentic Coding 차트에서 OpenCode 60.0%, Copilot 58.4%, Claude 57.4%, Pi 54.5%보다 낮고 Mini-SWE agent 50.7%보다 높음. 이미지와 README는 동일한 측정 조건이라고 명시되지 않음 |
| Terminal-Bench 2.1 | score | 23.46% | 제공 이미지의 Agentic Coding 차트에서 Mini-SWE agent 29.7%, OpenCode 29.1%, Claude 29.0%, Copilot 27.0%보다 낮고 Pi 24.5%보다 낮음. 이미지와 README는 동일한 측정 조건이라고 명시되지 않음 |
이미지 분석


113
Likes
19.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.