본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4

1M 토큰 장문 처리와 추론·코딩·Agent 시스템을 위한 text-generation30B 전체, 3B 활성 MoE 파라미터최대 1M 토큰 컨텍스트OpenMDW License Agreement 1.1

30B MoE의 3B 활성 구조와 NVFP4 양자화로 장문 Reasoning·Coding Agent 배포를 겨냥한 모델

학습 방식 · Nemotron-3.5-Lightning-30B-A3B 기반의 NVFP4 양자화 모델로, 20T 토큰 이상 Pre-training과 MTP Continued Pre-training을 거쳤다. 이후 Code·Math·Science·Tool Calling·Instruction Following 데이터로 SFT하고, GRPO를 활용한 비동기 Multi-environment Reinforcement Learning을 적용했다. 마지막으로 NVIDIA Model Optimizer의 Four Over Six NVFP4 W4A16 PTQ를 Routed·Shared Expert에 적용하고 Mamba Projection과 KV cache에는 FP8 동적 스케일을 사용했다.

TL;DR

NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4는 Nemotron-3.5-Lightning-30B-A3B를 NVFP4로 양자화한 MoE 기반 Reasoning·Chat 모델이다. Mamba-2와 MoE, 선택적 Attention을 결합하고 전체 30B 중 3B만 활성화해 최대 1M 토큰 문맥과 장시간 Agent 작업을 겨냥한다. MTP와 DSpark·DFlash Speculative Decoding으로 여러 토큰을 한 번에 예측하거나 외부 Draft를 활용하며, vLLM·TensorRT-LLM·SGLang에서 NVIDIA GPU 배포를 지원한다. NVFP4 평가에서 SWE-bench Verified 52.80%, IFBench 72.88%, GDPval-AA-V2 865점을 기록했고, BF16 대비 일부 코딩·지시 이행 지표는 높지만 HLE와 AA-LCR은 낮았다.

핵심 포인트

  • NVFP4로 저장한 양자화 모델이며 기반은 Nemotron-3.5-Lightning-30B-A3B이다. 전체 30B 파라미터 중 추론마다 3B만 활성화한다. W4A16과 FP8 스케일을 조합해 NVIDIA GPU에서 메모리 부담을 낮춘다.
  • Mamba-2, MoE, 선택적 Attention을 교차 배치한 Hybrid 구조다. Mamba-2가 시퀀스 처리를 담당하고 MoE가 입력에 따라 일부 Expert를 선택한다. 전체 파라미터보다 활성 파라미터가 작아 장시간 Agent 작업과 Sub-agent 운용에 맞는다.
  • 최대 1M 토큰 입력을 처리하며 MTP와 외부 Drafter를 이용한 Speculative Decoding을 지원한다. DSpark는 한 번의 Forward Pass에서 토큰 블록을 제안하고 DFlash는 Block Diffusion 방식으로 Draft를 생성한다. DGX Spark 저동시성 환경에서는 DSpark를 권장하고 H100 고처리량 환경에서는 별도 설정을 사용한다.
  • 20T 토큰 이상 Pre-training 뒤 MTP Continued Pre-training, SFT, GRPO 기반 Reinforcement Learning, NVFP4 PTQ를 순서대로 거쳤다. SFT에는 Code·Math·Science·Tool Calling·Structured Output 데이터가 포함됐다. GRPO 학습은 다단계 Tool Use와 Multi-turn 대화까지 포함해 Reasoning 및 Agent 동작을 겨냥한다.

제한사항

  • NVFP4 수치는 NVIDIA가 일관된 NeMo Gym 및 NeMo Evaluator 설정으로 측정한 결과다. 다른 공급자의 Prompt·Parser·Inference 설정을 쓰면 점수가 달라질 수 있다. 실제 Agent 시스템에서는 도구 연결과 업무 데이터에 대한 별도 검증이 필요하다.
  • 주요 지원 언어는 English, Spanish, French, German, Italian, Japanese와 Coding languages다. README의 모델 카드 언어 목록에는 Korean이 포함되지 않는다. 비영어권 업무에 적용할 때는 대상 언어별 품질 평가가 필요하다.
  • 학습 데이터가 모든 인구집단을 균등하게 대표하지 않는다고 명시돼 있다. 일부 데이터셋에서는 성별·인종 관련 표현의 분포 편향이 확인됐다. 상용 배포 전에는 Bias audit와 사용 도메인별 안전성 검증이 필요하다.

벤치마크

벤치마크지표비교
MMLU Proaccuracy81.62기반 BF16 체크포인트: 81.94, NVFP4 측정값은 기반 대비 -0.32
GPQA Diamond (no tools)accuracy75.57기반 BF16 체크포인트: 75.44, NVFP4 측정값은 기반 대비 +0.13
HLE (text-only, no tools)accuracy10.47기반 BF16 체크포인트: 11.72, NVFP4 측정값은 기반 대비 -1.25
SWE-bench Verifiedaccuracy52.80기반 BF16 체크포인트: 51.56, NVFP4 측정값은 기반 대비 +1.24
Terminal-Bench 2.1accuracy23.46기반 BF16 체크포인트: 24.58, NVFP4 측정값은 기반 대비 -1.12
IFBench (loose)accuracy72.88기반 BF16 체크포인트: 71.88, NVFP4 측정값은 기반 대비 +1.00
AA-LCRaccuracy49.19기반 BF16 체크포인트: 52.00, NVFP4 측정값은 기반 대비 -2.81
GDPval-AA-V2score865기반 BF16 체크포인트: 832, NVFP4 측정값은 기반 대비 +33
SWE-Bench Verifiedscore52.80%제공 이미지의 Agentic Coding 차트에서 OpenCode 60.0%, Copilot 58.4%, Claude 57.4%, Pi 54.5%보다 낮고 Mini-SWE agent 50.7%보다 높음. 이미지와 README는 동일한 측정 조건이라고 명시되지 않음
Terminal-Bench 2.1score23.46%제공 이미지의 Agentic Coding 차트에서 Mini-SWE agent 29.7%, OpenCode 29.1%, Claude 29.0%, Copilot 27.0%보다 낮고 Pi 24.5%보다 낮음. 이미지와 README는 동일한 측정 조건이라고 명시되지 않음

이미지 분석

Nemotron-3.5-Lightning-30B-A3B-NVFP4와 BF16 체크포인트 및 Qwen-3.6-35B-A3B, Gemma-4-26B-A4B-it의 6개 벤치마크 정확도를 비교한 막대그래프다.
NVFP4 모델은 IFBench 72.2%, SWE-Bench 51.6%, HLE 10.9%, Terminal-Bench 24.6%, τ³-bench 7.0%, AA-LCR 32.8%로 표시됐다. BF16과 비교하면 IFBench와 Terminal-Bench에서는 71.9%와 24.6%로 거의 같지만, AA-LCR은 52.0%에서 32.8%로 낮게 표시된다. Qwen-3.6-35B-A3B는 SWE-Bench 70.1%와 Terminal-Bench 44.4%에서 높고, NVFP4 모델은 IFBench 72.2%에서 Qwen의 63.7%를 앞선다.
SWE-Bench Verified와 Terminal-Bench 2.1에서 여러 Coding Agent의 점수를 나란히 비교한 차트다.
SWE-Bench Verified에서는 OpenCode 60.0%, Copilot 58.4%, Claude 57.4%, Pi 54.5%, Mini-SWE agent 50.7%, OpenHands 48.7%, Hermes 45.7%, Codex 11.0% 순으로 표시됐다. Terminal-Bench 2.1에서는 Mini-SWE agent 29.7%, OpenCode 29.1%, Claude 29.0%, Copilot 27.0%, OpenHands 26.1%, Hermes 25.8%, Pi 24.5%, Codex 2.9%로 표시됐다. 이 차트의 모델별 Harness 설정과 README의 NVFP4 측정 조건이 동일하다는 명시는 없어 직접 순위를 확정하기 어렵다.

113

Likes

19.3k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.