본문으로 건너뛰기

NVIDIA Nemotron 3.5 Lightning의 에이전트 실행 최적화

Nemotron 3.5 Lightning은 30B 규모에서 3B만 활성화해 반복적인 AI agent 실행을 빠르게 처리한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

장시간 실행되는 AI agent는 계획 수립보다 tool call, 파일 처리, 검증처럼 반복적인 실행 단계에 더 많은 시간을 쓰므로 모든 작업에 frontier reasoning model을 적용하면 비용과 지연이 커집니다. NVIDIA Nemotron 3.5 Lightning은 30B total parameters 중 약 3B만 활성화하는 Mixture-of-Experts와 Mamba-2, Selective Attention, Multi-Token Prediction을 결합해 실행 계층의 처리량을 높이도록 설계됐습니다. MTP·DSpark·DFlash speculative decoding과 NVFP4 quantization을 지원하며, NVIDIA가 인용한 자료는 유사한 크기 모델보다 최대 4배 빠른 output speed를 언급합니다. BF16과 NVFP4 벤치마크 점수가 대체로 근접한 가운데, NVIDIA Build API·OpenRouter·Ollama·자체 호스팅 vLLM을 통해 구조화된 agent workload에 적용할 수 있지만 실제 serving 경로는 concurrency별 benchmark가 필요합니다.

섹션별 상세

01
장시간 실행되는 AI agent는 초기 계획을 세우는 어려운 reasoning보다 tool call, 파일 읽기, 검증, 명령 실행처럼 반복적인 작업에 더 많은 시간을 쓸 수 있습니다. 모든 단계에 frontier reasoning model을 사용하면 동일한 실행 과정을 높은 비용과 지연으로 반복하게 됩니다. NVIDIA는 어려운 판단은 고성능 모델에 맡기고 대량 실행은 빠른 모델이 처리하는 분업 구조를 Nemotron 3.5 Lightning의 핵심 용도로 제시합니다.
Coding agent가 저장소를 살피고 파일을 읽은 뒤 검색 도구를 호출하고, 코드를 수정·테스트·오류 검사한 후 결과를 검증하는 순서도입니다.
Diagram이미지는 agent 작업을 Explore, Edit and Verify, Conclude의 세 구간으로 나눕니다. 테스트가 통과할 때까지 코드 수정과 테스트를 반복한 뒤 결과 검증과 structured response 생성으로 마무리하는 흐름은 Nemotron 3.5 Lightning이 담당하도록 설계된 고빈도 실행 작업의 성격을 보여줍니다.
02
Nemotron 3.5 Lightning은 전체 30B parameters 중 토큰마다 약 3B만 활성화하는 open-weight reasoning 및 instruction model입니다. 최대 1M tokens의 context window, text 입출력, configurable reasoning, tool calling을 지원하며 BF16 full-precision checkpoint와 NVFP4·W4A16 quantization 옵션을 제공합니다. OpenMDW 1.1 license와 2026년 8월 11일 release date가 명시됐고, 영어와 programming languages를 중심으로 Spanish, French, German, Italian, Japanese도 공식 지원 언어에 포함됩니다.
근거
  • Nemotron 3.5 Lightning은 전체 30B parameters 중 약 3B만 토큰마다 활성화한다. What is NVIDIA Nemotron 3.5 Lightning?의 핵심 사양 표와 Architecture Deep Dive의 Mixture-of-Experts 절
  • 모델은 최대 1M tokens context window를 지원하지만 provider별 노출 한도는 더 작을 수 있다. What is NVIDIA Nemotron 3.5 Lightning?의 사양 표와 FAQ Q3
03
모델은 Mamba-2, Mixture-of-Experts, Selective Attention, Multi-Token Prediction을 결합한 hybrid architecture를 사용합니다. Router가 128 routed experts와 shared expert 중 토큰별로 6개 routed experts를 선택하고, 52 hidden layers 안에서 Mamba·MoE·sparse Attention 구성요소가 이어지도록 설계됐습니다. Mamba-2는 긴 시퀀스를 상태공간 방식으로 처리하고, 선택된 Attention은 장거리 token interaction을 유지하며, MTP는 여러 미래 토큰을 제안해 이후 검증 단계의 효율을 높입니다.
입력 token stream을 Gating Network 또는 Router가 여러 Specialized Feed-Forward Network로 보내고, 결과를 Weighted Sum/Aggregator에서 결합하는 MoE 구조입니다.
Diagram라우터가 모든 Expert를 동시에 실행하지 않고 입력별로 일부 Specialized Feed-Forward Network를 선택한 뒤 가중합을 다음 Transformer layer로 전달합니다. 이 흐름은 Nemotron 3.5 Lightning의 30B total parameters와 약 3B active parameters라는 sparse computation 원리를 시각화합니다.
Input Tokens 이후 Mamba-2, MoE, Mamba-2, Attention, MoE 블록이 교차 배치되는 hybrid block stack입니다.
Diagram전체 블록을 동일한 dense FFN과 Attention으로 채우지 않고 Mamba-2, MoE, Attention을 반복적으로 배치합니다. 이미지의 구조는 Mamba-2로 시퀀스 처리 비용을 줄이면서 선택된 Attention으로 장거리 상호작용을 유지한다는 아키텍처 설명과 직접 연결됩니다.
근거
  • 모델은 Mamba-2, Mixture-of-Experts, Selective Attention, Multi-Token Prediction을 결합한다. Architecture Deep Dive 첫 문장과 Mamba-2, Selective Attention, Multi-Token Prediction 절
04
출력 속도는 한 가지 최적화가 아니라 MoE sparsity, hybrid Mamba, NVFP4, MTP, speculative decoding의 결합에서 나옵니다. NVIDIA가 제공하는 speculative decoding 경로는 모델에 통합된 MTP, DGX Spark와 낮은 concurrency에 맞춘 DSpark, 비교 측정을 위한 DFlash이며, medium·high concurrency에서는 MTP를 특히 권장합니다. 기사에 인용된 자료는 유사한 크기 모델보다 최대 4배 빠른 output speed를 언급하지만, 실제 serving path는 concurrency와 workload 특성에 따라 benchmark로 선택해야 한다고 전제합니다.
동시성 수준과 serving 특성에 따라 DSpark, MTP, DFlash를 선택하도록 안내하는 의사결정 도표입니다.
InfographicLow concurrency에서는 DSpark, medium·high concurrency에서는 MTP를 고려하고, serving characteristics가 다르면 DFlash를 직접 benchmark하도록 구성됐습니다. 따라서 speculative decoding 경로는 고정된 정답이 아니라 실제 workload의 concurrency와 측정 결과에 따라 정해야 합니다.
40B 미만 open-weight model의 Artificial Analysis Intelligence Index와 output speed를 비교한 산점도입니다. Nemotron 3.5 Lightning은 약 670 output tokens per second와 약 24의 intelligence index 위치에 표시됩니다.
Chart차트는 Nemotron 3.5 Lightning을 높은 출력 속도와 비교적 높은 intelligence index가 함께 있는 초록색 매력 구간에 배치합니다. Qwen3.6 27B와 Qwen3.6 35B A3B, Gemma 4 계열, gpt-oss-20b 및 Nemotron 3 Nano와의 속도·지능 지표 비교를 통해 agent execution에서 throughput을 강조합니다.
근거
  • NVIDIA는 MTP, DSpark, DFlash 세 가지 speculative decoding 접근법을 제공한다. Why Is Nemotron 3.5 Lightning So Fast?의 speculative decoding 절과 serving path 이미지
  • NVIDIA가 인용한 자료는 유사한 크기 모델보다 최대 4배 빠른 output speed를 언급한다. Why Is Nemotron 3.5 Lightning So Fast? 마지막 문장과 Intelligence Index vs. Output Speed 차트
05
공식 벤치마크에서 BF16과 NVFP4의 품질 차이는 모든 항목에서 크게 벌어지지 않았습니다. 예를 들어 MMLU Pro는 81.94와 81.62, GPQA Diamond는 75.44와 75.57, SWE-bench Verified는 51.56과 52.80, Terminal-Bench 2.1은 24.58과 23.46으로 기록됐습니다. 평가는 NeMo Gym과 NeMo Evaluator 기반의 일관된 harness에서 수행됐으며, benchmark-native units가 유지되므로 모든 수치를 백분율로 해석하면 안 됩니다.
Nemotron-3.5-Lightning-30B-A3B와 Nemotron-3-Nano-30B-A3B-NVFP4, Qwen-3.6-35B-A3B, Gemma-4-26B-A4B-it의 IFBench, SWE-Bench, HLE, Terminal-Bench, τ³-bench, AA-LCR 정확도를 비교한 막대그래프입니다.
ChartNemotron-3.5-Lightning-30B-A3B-BF16은 IFBench 71.9, SWE-Bench 51.6, HLE 11.7, Terminal-Bench 24.6, τ³-bench 9.3, AA-LCR 52.0으로 표시됩니다. 이 시각화는 모델의 강점이 단일 일반 지능 점수보다 instruction following, coding, terminal use, long-context 등 agent 관련 작업군에서 어떻게 분산되는지 비교하게 합니다.
근거
  • MMLU Pro는 BF16 81.94, NVFP4 81.62이며 SWE-bench Verified는 BF16 51.56, NVFP4 52.80이다. NVIDIA Nemotron 3.5 Lightning Benchmark Results의 공식 결과 표
06
배포 경로는 NVIDIA Build API, OpenRouter, Fireworks, Ollama, 자체 호스팅 vLLM으로 나뉩니다. NVIDIA Build API와 OpenRouter free route는 1M context를 제공하는 무료 시험 경로이고, OpenRouter standard는 1M input tokens당 $0.05, output tokens당 $0.20이며 Fireworks는 cached input tokens에 $0.01을 별도로 책정합니다. 기사는 OpenAI-compatible endpoint와 Python client를 이용해 warranty claim을 JSON으로 판정하는 예제를 제시하며, 시를 생성하는 대신 구조화된 agent workload로 첫 테스트를 수행하는 편이 모델 목적에 맞다고 설명합니다.
bash
ollama run nemotron-3.5-lightning”

Ollama에서 Nemotron 3.5 Lightning을 내려받아 로컬로 실행하는 명령입니다.

python
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://integrate.api.nvidia.com/v1",
    api_key=os.environ["NVIDIA_API_KEY"]
)

response = client.chat.completions.create(
    model="nvidia/nemotron-3.5-lightning-30b-a3b",
    messages=[
        {
            "role": "user",
            "content": """
A customer has submitted a warranty claim. Purchase date: 2025-04-12 Claim date: 2026-03-02 Warranty duration: 12 months Damage type: manufacturing defect Determine whether the claim is within the warranty period. Return JSON with: decision rationale
"""
        }
    ],
    temperature=1.0,
    top_p=0.95,
    max_tokens=2000,
    extra_body={
        "chat_template_kwargs": {
            "enable_thinking": True
        },
        "reasoning_budget": 4000
    }
)
print(response.choices[0].message.content)

OpenAI 호환 NVIDIA API 엔드포인트에 모델을 연결하고 구조화된 JSON 응답을 요청하는 예제입니다.

07
NVIDIA가 제시하는 production architecture는 하나의 거대 모델만 사용하는 대신 planner, router, specialized worker, fast execution model, verification layer를 조합하는 형태입니다. Nemotron 3.5 Lightning은 가장 지능적인 모델일 필요 없이 routine agent task를 빠르게 처리하고, 더 어려운 작업은 상위 reasoning model로 escalation하는 역할을 맡습니다. 따라서 모델 규모를 계속 키우는 접근보다 작업별 모델 배치와 검증 루프를 최적화하는 방향이 핵심 의미입니다.
사용자 요청이 Frontier Reasoning Model의 planning과 strategy를 거쳐 Task Router로 전달되고, 여러 Lightning Worker와 Tool Execution을 통과하는 agent 처리 흐름입니다.
DiagramTask Router는 요청을 Lightning Worker A·B·C로 분배하고, 각 worker의 결과를 Tool Execution과 Validation/Reviewer로 보냅니다. 검증 결과가 불완전하면 Frontier Model이 다시 평가하고 router로 되돌아가며, 완료된 경우 Final Response를 생성하는 escalation 및 검증 루프가 나타납니다.

용어 해설

Mixture-of-Experts
여러 개의 전문 하위 네트워크 중 일부만 선택해 토큰을 처리하는 구조입니다. 라우터가 입력별로 활성화할 Expert를 고르고, 선택된 결과를 가중합으로 결합합니다. 전체 파라미터 규모를 유지하면서 실제 추론 연산량과 메모리 부담을 낮추는 데 중요합니다.
상태공간 모델(State-Space Model)
순차 데이터를 내부 상태로 압축해 처리하는 모델 계열입니다. Mamba-2는 긴 시퀀스의 정보를 상태 갱신 방식으로 다루어 모든 토큰 쌍을 직접 비교하는 Attention의 비용을 줄입니다. 긴 문맥을 처리하는 효율이 핵심 장점입니다.
추측 디코딩(Speculative Decoding)
초안 모델이나 별도 예측 모듈이 여러 후보 토큰을 먼저 생성하고, 주 모델이 이를 한 번에 검증하는 추론 기법입니다. Nemotron 3.5 Lightning은 MTP, DSpark, DFlash 경로를 지원합니다. 후보가 승인되면 토큰 생성 단계 수가 줄어 처리량이 높아집니다.
다중 토큰 예측(Multi-Token Prediction)
다음 토큰 하나만 예측하는 대신 여러 미래 토큰을 함께 제안하도록 학습하는 방식입니다. Nemotron 3.5 Lightning은 MTP 전용 continued-pretraining 단계를 거쳤고, 추론 중 제안된 후보를 효율적으로 검증합니다. 이 구조가 높은 출력 속도를 뒷받침합니다.
NVFP4 양자화(NVFP4)
가중치와 연산을 낮은 정밀도로 표현해 모델의 메모리 사용량과 계산량을 줄이는 NVIDIA의 양자화 옵션입니다. Nemotron 3.5 Lightning은 BF16과 NVFP4 결과를 함께 제공하며, 기사에 인용된 여러 벤치마크에서 두 설정의 점수가 근접했습니다. 하드웨어와 배포 환경에 따라 적용 효과가 달라집니다.

기술

  • Nemotron 3.5 Lightning
  • Mamba-2
  • Mixture-of-Experts
  • Selective Attention
  • Multi-Token Prediction
  • NVFP4
  • W4A16
  • BF16
  • MTP
  • DSpark
  • DFlash
  • NeMo Gym
  • NeMo Evaluator
  • vLLM
  • Ollama
  • OpenRouter
  • Fireworks
  • OpenAI API

활용 사례

  • coding agent의 반복적인 tool execution
  • 파일 읽기와 코드 검색
  • 코드 수정·테스트·오류 검사 루프
  • 구조화된 JSON 응답 생성
  • 장시간 실행되는 고처리량 AI agent
  • 낮은 concurrency의 로컬·데이터센터 추론
  • 중간·높은 concurrency의 server inference

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 14.수집 2026. 08. 14.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.