nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16
Mamba-2·MoE·Attention을 결합한 3B 활성 파라미터 BF16 reasoning 모델
학습 방식 · Nemotron 3 Foundation 계열을 기반으로 20T tokens 이상을 사전 학습한 뒤 MTP continued pre-training, synthetic code·math·science·tool-calling 데이터 기반 SFT, GRPO 기반 multi-environment RL을 적용했다.
TL;DR
이 모델은 별도 Fine-tune이나 LoRA가 아닌 Nemotron 3.5 Lightning의 BF16 full-precision reference release이며, Nemotron 3 Foundation 계열을 바탕으로 한 reasoning·chat 모델이다. Mamba-2와 MoE, 선택적 Attention을 결합하고 30B 중 3B만 활성화해 긴 문맥 처리와 계산 효율을 함께 겨냥하며, 최대 1M tokens 문맥과 configurable reasoning을 지원한다. MTP와 DSpark·DFlash speculative decoding은 여러 미래 토큰 또는 draft block을 미리 예측해 생성 과정을 단축하는 구조다. README 수치에서 IFBench는 71.88, SWE-bench Verified는 51.56, AA-LCR은 52.00이며, 직접 서비스보다 SFT·RL·distillation·domain adaptation과 자체 양자화의 출발점으로 쓰는 용도에 맞는다.
핵심 포인트
- 30B 파라미터 중 3B만 활성화하는 MoE 구조로 계산량을 줄인다.
- Mamba-2, MoE, Attention을 교차 배치해 긴 문맥과 생성 효율을 함께 겨냥한다.
- BF16 reference weights라 SFT, RL, distillation과 자체 양자화의 출발점으로 적합하다.
- Reasoning을 chat template에서 켜고 끄며 MTP와 speculative decoding으로 생성을 가속한다.
제한사항
- BF16 reference release는 직접적인 production inference보다 customization과 full-precision research를 우선한다. 단일 GPU 배포에는 1× H100 80GB 또는 1× A100 80GB가 필요하다. latency와 throughput 최적화가 목적이면 README는 NVFP4 release를 권장한다.
- 최대 1M tokens 문맥은 모든 환경에서 동일하게 운용되는 설정이 아니다. 단일 H100 배포에서는 256K를 사용하며 1M 설정에는 8× H100 또는 GB200용 vLLM 구성이 제시됐다. 실제 처리 길이는 GPU 메모리와 동시성에 맞춰 낮춰야 한다.
- 학습·post-training 데이터가 모든 인구집단을 균등하게 대표하지 않는다고 README가 명시한다. 일부 데이터셋에서는 연령·성별·민족 관련 언급이 64~99%의 샘플에 없고, 존재하는 표본에서도 표현 편향이 보고됐다. 배포 전 용도별 안전성 검증과 bias audit가 필요하다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MMLU Pro | accuracy | 81.94 | Qwen 3.6 35B A3B 85.63, Gemma 4 26B A4B 85.20 |
| AA-Omniscience | accuracy | 17.50 | Qwen 3.6 35B A3B 19.47, Gemma 4 26B A4B 22.17 |
| GPQA Diamond (no tools) | accuracy | 75.44 | Qwen 3.6 35B A3B 83.40, Gemma 4 26B A4B 79.61 |
| HLE (text-only, no tools) | accuracy | 11.72 | Qwen 3.6 35B A3B 19.56, Gemma 4 26B A4B 17.42 |
| SciCode | accuracy | 32.60 | Qwen 3.6 35B A3B 35.33, Gemma 4 26B A4B 40.28 |
| SWE-bench Verified | accuracy | 51.56 | Qwen 3.6 35B A3B 70.12, Gemma 4 26B A4B 57.40 |
| SWE-bench Multilingual | accuracy | 39.33 | Qwen 3.6 35B A3B 63.40, Gemma 4 26B A4B 43.40 |
| Terminal-Bench 2.1 | accuracy | 24.58 | Qwen 3.6 35B A3B 44.38, Gemma 4 26B A4B 37.22 |
| PinchBench | accuracy | 85.37 | Qwen 3.6 35B A3B 88.07, Gemma 4 26B A4B 74.70 |
| BrowseComp | accuracy | 36.97 | Qwen 3.6 35B A3B 48.74, Gemma 4 26B A4B 26.30 |
| τ³-bench (Banking) | accuracy | 9.28 | Qwen 3.6 35B A3B 10.52, Gemma 4 26B A4B 14.02 |
| GDPval-AA-V2 | score | 832 | Qwen 3.6 35B A3B 1015, Gemma 4 26B A4B 807 |
| IFBench (loose) | accuracy | 71.88 | Qwen 3.6 35B A3B 63.71, Gemma 4 26B A4B 77.25 |
| AA-LCR | accuracy | 52.00 | Qwen 3.6 35B A3B 61.06, Gemma 4 26B A4B 57.56 |
| SWE-bench Verified harness comparison | accuracy | 60.0% OpenCode, 58.4% Copilot, 57.4% Claude, 54.5% Pi, 50.7% Mini-SWE agent, 48.7% OpenHands, 45.7% Hermes, 11.0% Codex | README의 별도 agentic coding 이미지 수치이며 모델 자체 점수가 아니라 harness별 비교 결과 |
| Terminal-Bench 2.1 harness comparison | accuracy | 29.7% Mini-SWE agent, 29.1% OpenCode, 29.0% Claude, 27.0% Copilot, 26.1% OpenHands, 25.8% Hermes, 24.5% Pi, 2.9% Codex | README의 별도 agentic coding 이미지 수치이며 모델 자체 점수가 아니라 harness별 비교 결과 |
이미지 분석


69
Likes
15.7k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.