TL;DR
장시간 실행되는 AI agent는 계획 수립보다 tool call, 파일 처리, 검증처럼 반복적인 실행 단계에 더 많은 시간을 쓰므로 모든 작업에 frontier reasoning model을 적용하면 비용과 지연이 커집니다. NVIDIA Nemotron 3.5 Lightning은 30B total parameters 중 약 3B만 활성화하는 Mixture-of-Experts와 Mamba-2, Selective Attention, Multi-Token Prediction을 결합해 실행 계층의 처리량을 높이도록 설계됐습니다. MTP·DSpark·DFlash speculative decoding과 NVFP4 quantization을 지원하며, NVIDIA가 인용한 자료는 유사한 크기 모델보다 최대 4배 빠른 output speed를 언급합니다. BF16과 NVFP4 벤치마크 점수가 대체로 근접한 가운데, NVIDIA Build API·OpenRouter·Ollama·자체 호스팅 vLLM을 통해 구조화된 agent workload에 적용할 수 있지만 실제 serving 경로는 concurrency별 benchmark가 필요합니다.
섹션별 상세

- Nemotron 3.5 Lightning은 전체 30B parameters 중 약 3B만 토큰마다 활성화한다. — What is NVIDIA Nemotron 3.5 Lightning?의 핵심 사양 표와 Architecture Deep Dive의 Mixture-of-Experts 절
- 모델은 최대 1M tokens context window를 지원하지만 provider별 노출 한도는 더 작을 수 있다. — What is NVIDIA Nemotron 3.5 Lightning?의 사양 표와 FAQ Q3


- 모델은 Mamba-2, Mixture-of-Experts, Selective Attention, Multi-Token Prediction을 결합한다. — Architecture Deep Dive 첫 문장과 Mamba-2, Selective Attention, Multi-Token Prediction 절


- NVIDIA는 MTP, DSpark, DFlash 세 가지 speculative decoding 접근법을 제공한다. — Why Is Nemotron 3.5 Lightning So Fast?의 speculative decoding 절과 serving path 이미지
- NVIDIA가 인용한 자료는 유사한 크기 모델보다 최대 4배 빠른 output speed를 언급한다. — Why Is Nemotron 3.5 Lightning So Fast? 마지막 문장과 Intelligence Index vs. Output Speed 차트

- MMLU Pro는 BF16 81.94, NVFP4 81.62이며 SWE-bench Verified는 BF16 51.56, NVFP4 52.80이다. — NVIDIA Nemotron 3.5 Lightning Benchmark Results의 공식 결과 표
ollama run nemotron-3.5-lightning”Ollama에서 Nemotron 3.5 Lightning을 내려받아 로컬로 실행하는 명령입니다.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://integrate.api.nvidia.com/v1",
api_key=os.environ["NVIDIA_API_KEY"]
)
response = client.chat.completions.create(
model="nvidia/nemotron-3.5-lightning-30b-a3b",
messages=[
{
"role": "user",
"content": """
A customer has submitted a warranty claim. Purchase date: 2025-04-12 Claim date: 2026-03-02 Warranty duration: 12 months Damage type: manufacturing defect Determine whether the claim is within the warranty period. Return JSON with: decision rationale
"""
}
],
temperature=1.0,
top_p=0.95,
max_tokens=2000,
extra_body={
"chat_template_kwargs": {
"enable_thinking": True
},
"reasoning_budget": 4000
}
)
print(response.choices[0].message.content)OpenAI 호환 NVIDIA API 엔드포인트에 모델을 연결하고 구조화된 JSON 응답을 요청하는 예제입니다.

용어 해설
- Mixture-of-Experts
- — 여러 개의 전문 하위 네트워크 중 일부만 선택해 토큰을 처리하는 구조입니다. 라우터가 입력별로 활성화할 Expert를 고르고, 선택된 결과를 가중합으로 결합합니다. 전체 파라미터 규모를 유지하면서 실제 추론 연산량과 메모리 부담을 낮추는 데 중요합니다.
- 상태공간 모델(State-Space Model)
- — 순차 데이터를 내부 상태로 압축해 처리하는 모델 계열입니다. Mamba-2는 긴 시퀀스의 정보를 상태 갱신 방식으로 다루어 모든 토큰 쌍을 직접 비교하는 Attention의 비용을 줄입니다. 긴 문맥을 처리하는 효율이 핵심 장점입니다.
- 추측 디코딩(Speculative Decoding)
- — 초안 모델이나 별도 예측 모듈이 여러 후보 토큰을 먼저 생성하고, 주 모델이 이를 한 번에 검증하는 추론 기법입니다. Nemotron 3.5 Lightning은 MTP, DSpark, DFlash 경로를 지원합니다. 후보가 승인되면 토큰 생성 단계 수가 줄어 처리량이 높아집니다.
- 다중 토큰 예측(Multi-Token Prediction)
- — 다음 토큰 하나만 예측하는 대신 여러 미래 토큰을 함께 제안하도록 학습하는 방식입니다. Nemotron 3.5 Lightning은 MTP 전용 continued-pretraining 단계를 거쳤고, 추론 중 제안된 후보를 효율적으로 검증합니다. 이 구조가 높은 출력 속도를 뒷받침합니다.
- NVFP4 양자화(NVFP4)
- — 가중치와 연산을 낮은 정밀도로 표현해 모델의 메모리 사용량과 계산량을 줄이는 NVIDIA의 양자화 옵션입니다. Nemotron 3.5 Lightning은 BF16과 NVFP4 결과를 함께 제공하며, 기사에 인용된 여러 벤치마크에서 두 설정의 점수가 근접했습니다. 하드웨어와 배포 환경에 따라 적용 효과가 달라집니다.
기술
- Nemotron 3.5 Lightning
- Mamba-2
- Mixture-of-Experts
- Selective Attention
- Multi-Token Prediction
- NVFP4
- W4A16
- BF16
- MTP
- DSpark
- DFlash
- NeMo Gym
- NeMo Evaluator
- vLLM
- Ollama
- OpenRouter
- Fireworks
- OpenAI API
활용 사례
- coding agent의 반복적인 tool execution
- 파일 읽기와 코드 검색
- 코드 수정·테스트·오류 검사 루프
- 구조화된 JSON 응답 생성
- 장시간 실행되는 고처리량 AI agent
- 낮은 concurrency의 로컬·데이터센터 추론
- 중간·높은 concurrency의 server inference
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.