본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16

추론·대화·코딩·도구 호출을 지원하는 text-generation 모델30B total / 3B active최대 1M tokens, 단일 H100에서는 256K 사용 컨텍스트OpenMDW-1.1

Mamba-2·MoE·Attention을 결합한 3B 활성 파라미터 BF16 reasoning 모델

학습 방식 · Nemotron 3 Foundation 계열을 기반으로 20T tokens 이상을 사전 학습한 뒤 MTP continued pre-training, synthetic code·math·science·tool-calling 데이터 기반 SFT, GRPO 기반 multi-environment RL을 적용했다.

TL;DR

이 모델은 별도 Fine-tune이나 LoRA가 아닌 Nemotron 3.5 Lightning의 BF16 full-precision reference release이며, Nemotron 3 Foundation 계열을 바탕으로 한 reasoning·chat 모델이다. Mamba-2와 MoE, 선택적 Attention을 결합하고 30B 중 3B만 활성화해 긴 문맥 처리와 계산 효율을 함께 겨냥하며, 최대 1M tokens 문맥과 configurable reasoning을 지원한다. MTP와 DSpark·DFlash speculative decoding은 여러 미래 토큰 또는 draft block을 미리 예측해 생성 과정을 단축하는 구조다. README 수치에서 IFBench는 71.88, SWE-bench Verified는 51.56, AA-LCR은 52.00이며, 직접 서비스보다 SFT·RL·distillation·domain adaptation과 자체 양자화의 출발점으로 쓰는 용도에 맞는다.

핵심 포인트

  • 30B 파라미터 중 3B만 활성화하는 MoE 구조로 계산량을 줄인다.
  • Mamba-2, MoE, Attention을 교차 배치해 긴 문맥과 생성 효율을 함께 겨냥한다.
  • BF16 reference weights라 SFT, RL, distillation과 자체 양자화의 출발점으로 적합하다.
  • Reasoning을 chat template에서 켜고 끄며 MTP와 speculative decoding으로 생성을 가속한다.

제한사항

  • BF16 reference release는 직접적인 production inference보다 customization과 full-precision research를 우선한다. 단일 GPU 배포에는 1× H100 80GB 또는 1× A100 80GB가 필요하다. latency와 throughput 최적화가 목적이면 README는 NVFP4 release를 권장한다.
  • 최대 1M tokens 문맥은 모든 환경에서 동일하게 운용되는 설정이 아니다. 단일 H100 배포에서는 256K를 사용하며 1M 설정에는 8× H100 또는 GB200용 vLLM 구성이 제시됐다. 실제 처리 길이는 GPU 메모리와 동시성에 맞춰 낮춰야 한다.
  • 학습·post-training 데이터가 모든 인구집단을 균등하게 대표하지 않는다고 README가 명시한다. 일부 데이터셋에서는 연령·성별·민족 관련 언급이 64~99%의 샘플에 없고, 존재하는 표본에서도 표현 편향이 보고됐다. 배포 전 용도별 안전성 검증과 bias audit가 필요하다.

벤치마크

벤치마크지표비교
MMLU Proaccuracy81.94Qwen 3.6 35B A3B 85.63, Gemma 4 26B A4B 85.20
AA-Omniscienceaccuracy17.50Qwen 3.6 35B A3B 19.47, Gemma 4 26B A4B 22.17
GPQA Diamond (no tools)accuracy75.44Qwen 3.6 35B A3B 83.40, Gemma 4 26B A4B 79.61
HLE (text-only, no tools)accuracy11.72Qwen 3.6 35B A3B 19.56, Gemma 4 26B A4B 17.42
SciCodeaccuracy32.60Qwen 3.6 35B A3B 35.33, Gemma 4 26B A4B 40.28
SWE-bench Verifiedaccuracy51.56Qwen 3.6 35B A3B 70.12, Gemma 4 26B A4B 57.40
SWE-bench Multilingualaccuracy39.33Qwen 3.6 35B A3B 63.40, Gemma 4 26B A4B 43.40
Terminal-Bench 2.1accuracy24.58Qwen 3.6 35B A3B 44.38, Gemma 4 26B A4B 37.22
PinchBenchaccuracy85.37Qwen 3.6 35B A3B 88.07, Gemma 4 26B A4B 74.70
BrowseCompaccuracy36.97Qwen 3.6 35B A3B 48.74, Gemma 4 26B A4B 26.30
τ³-bench (Banking)accuracy9.28Qwen 3.6 35B A3B 10.52, Gemma 4 26B A4B 14.02
GDPval-AA-V2score832Qwen 3.6 35B A3B 1015, Gemma 4 26B A4B 807
IFBench (loose)accuracy71.88Qwen 3.6 35B A3B 63.71, Gemma 4 26B A4B 77.25
AA-LCRaccuracy52.00Qwen 3.6 35B A3B 61.06, Gemma 4 26B A4B 57.56
SWE-bench Verified harness comparisonaccuracy60.0% OpenCode, 58.4% Copilot, 57.4% Claude, 54.5% Pi, 50.7% Mini-SWE agent, 48.7% OpenHands, 45.7% Hermes, 11.0% CodexREADME의 별도 agentic coding 이미지 수치이며 모델 자체 점수가 아니라 harness별 비교 결과
Terminal-Bench 2.1 harness comparisonaccuracy29.7% Mini-SWE agent, 29.1% OpenCode, 29.0% Claude, 27.0% Copilot, 26.1% OpenHands, 25.8% Hermes, 24.5% Pi, 2.9% CodexREADME의 별도 agentic coding 이미지 수치이며 모델 자체 점수가 아니라 harness별 비교 결과

이미지 분석

Nemotron-3.5-Lightning-30B-A3B-NVFP4와 Nemotron-3-Nano-30B-A3B-NVFP4, Qwen-3.6-35B-A3B, Gemma-4-26B-A4B-it의 6개 벤치마크 정확도를 비교한 막대그래프이다.
그래프에서 Lightning은 IFBench 72.9%, SWE-Bench 52.8%, HLE 10.5%, Terminal-Bench 23.5%, τ³-bench 9.5%, AA-LCR 49.2%로 표시된다. Qwen은 SWE-Bench 70.1%, HLE 19.6%, Terminal-Bench 44.4%, AA-LCR 61.1%로 앞서고, Lightning은 Nemotron-3-Nano의 SWE-Bench 34.1%와 AA-LCR 32.8%보다 높다. 그래프 제목은 BF16이지만 범례와 하단 주석은 Lightning 수치를 NVFP4로 표시한다고 적으므로 BF16 모델의 README 표와 직접 동일시하면 안 된다.
SWE-Bench Verified 500개 과제와 Terminal-Bench 2.1 89개 과제에서 여러 coding agent harness의 점수를 나란히 비교한 그래프이다.
SWE-Bench Verified에서는 OpenCode 60.0%, Copilot 58.4%, Claude 57.4%, Pi 54.5%, Mini-SWE agent 50.7%, OpenHands 48.7%, Hermes 45.7%, Codex 11.0% 순으로 표시된다. Terminal-Bench 2.1에서는 Mini-SWE agent 29.7%, OpenCode 29.1%, Claude 29.0%, Copilot 27.0%, OpenHands 26.1%, Hermes 25.8%, Pi 24.5%, Codex 2.9%로 나타난다. 주석은 수정하지 않은 harness system prompt와 표준 harness 설정으로 얻은 점수라고 밝혀, 모델 단독 성능보다 agent 실행 구성의 차이를 함께 반영하는 자료이다.

69

Likes

15.7k

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.