TL;DR
2026년에 공개된 소형 Open 모델은 대규모 데이터센터 모델에 가까운 추론·에이전트 기능을 제공하며 Jetson에서 로컬 실행이 가능해졌습니다. Nemotron 3.5 Lightning은 전체 300억 개 중 토큰마다 30억 개 파라미터만 활성화하는 Mixture-of-Experts 구조이고, Qwen3.8-27B는 270억 개 전체를 활성화하는 Dense 구조라 작업별 선택 기준이 다릅니다. NVFP4 양자화는 각 디코딩 단계의 데이터 이동과 메모리 부담을 줄이고, Speculative Decoding은 Draft 모델의 여러 토큰을 주 모델이 함께 검증해 처리량을 높입니다. 테스트 환경에서는 두 기법을 결합해 BF16 대비 최대 6.28배의 디코드 처리량 향상이 확인됐지만, 최적 방식은 Nemotron 3.5 Lightning에서 DSpark, Qwen3.8-27B에서 DFlash2로 달랐습니다. 실제 애플리케이션의 프롬프트와 데이터로 정확도, 토큰 수락률, 처리량을 함께 측정해야 배포 구성을 결정할 수 있습니다.
빠른 이해
새로운 점
2026년 소형 Open 모델을 Jetson에서 NVFP4와 모델별 Speculative Decoding 조합으로 실행하고, 애플리케이션 프롬프트 기준까지 포함한 검증 절차를 제시합니다.
핵심 메커니즘
BF16 기준 모델에 NVFP4 양자화를 적용해 각 디코딩 단계의 데이터 이동·메모리 비용을 줄인 뒤, Draft 모델이 제안한 여러 토큰을 주 모델이 한 번에 검증하는 Speculative Decoding을 결합합니다. Nemotron 3.5 Lightning에는 DSpark, Qwen3.8-27B에는 DFlash2를 연결하고, vLLM에서 모델별 체크포인트·토큰 수·메모리 설정을 지정해 로컬 추론 처리량을 높입니다.
핵심 수치
- BF16 대비 최대 디코드 처리량 향상: 최대 6.28배- Jetson에서 NVFP4와 모델별 최적 Speculative Decoding 구성을 결합한 결과
- Nemotron 3.5 Lightning 출력 처리량: 123.01~138.02 output tokens/s- DSpark 구성으로 writing, reasoning, summarization, RAG 범주 측정
- Qwen3.8-27B 출력 처리량: 27.69~34.44 output tokens/s- DFlash2 구성으로 writing, reasoning, summarization, RAG 범주 측정
- Nemotron 3.5 Lightning 활성 파라미터: 전체 30B 중 토큰당 3B- Mixture-of-Experts 구조
- Qwen3.8-27B 활성 파라미터: 토큰당 27B 전체- Dense 구조
섹션별 상세
Jetson 에지 추론의 전환점
모델 구조에 따른 선택 기준
NVFP4와 Speculative Decoding
docker run --pull=always --runtime nvidia --rm -it \\--network host \\--ipc=host \\-v ~/.cache/huggingface:/root/.cache/huggingface \\--entrypoint bash \\vllm/vllm-openai:v0.28.0NVIDIA Container Runtime이 설정된 Jetson에서 vLLM OpenAI 컨테이너를 실행합니다.
vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \\ --reasoning-parser nemotron_v3 \\ --enable-auto-tool-choice \\ --tool-call-parser qwen3_coder \\ --max-model-len 128000 \\ --kv-cache-dtype fp8 \\ --gpu-memory-utilization 0.7 \\ --trust-remote-code \\ --max-num-batched-tokens 16384 \\ --enable-prefix-caching \\ --speculative-config '{"method":"dspark","model":"nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark","num_speculative_tokens":5}' \\ --mamba-backend flashinfer \\ --mamba-ssm-cache-dtype float16 \\ --enable-mamba-cache-stochastic-rounding \\ --mamba-cache-philox-rounds 5 \\ --mamba-cache-mode alignNVFP4와 DSpark를 결합한 Nemotron 3.5 Lightning 서빙 설정을 vLLM에 전달합니다.
VLLM_GDN_DECODE_KERNEL=triton vllm serve Inferact/Qwen3.8-27B-NVFP4 \\ --served-model-name qwen38 \\ --reasoning-parser qwen3 \\ --enable-auto-tool-choice \\ --tool-call-parser qwen3_coder \\ --max-model-len 50000 \\ --max-num-seqs 8 \\ --gpu-memory-utilization 0.85 \\ --trust-remote-code \\ --speculative-config '{"method":"dflash","model":"incoai/Qwen3.8-27B-DFlash2","num_speculative_tokens":7}'NVFP4와 DFlash2를 결합한 Qwen3.8-27B 서빙 설정을 vLLM으로 실행합니다.
vLLM 배포 설정과 Draft 방식
실제 작업 기준의 성능 검증
용어 해설
- Mixture-of-Experts
- — 여러 전문가 모듈 중 일부만 선택해 토큰을 처리하는 모델 구조입니다. Nemotron 3.5 Lightning은 전체 300억 개 파라미터를 보유하지만 토큰마다 30억 개만 활성화해 연산량과 생성 속도 측면에서 Dense 모델과 다른 특성을 만듭니다.
- NVFP4 양자화(NVFP4 Quantization)
- — 모델 가중치와 연산 값을 낮은 정밀도로 표현해 GPU가 이동·처리해야 할 데이터 양을 줄이는 최적화 기법입니다. Jetson에서는 BF16 대비 메모리 사용량과 토큰별 처리 비용을 낮추면서 생성 품질을 가깝게 유지하는 데 쓰입니다.
- 추측 디코딩(Speculative Decoding)
- — 작은 Draft 모델이 여러 토큰을 먼저 제안하고 주 모델이 이를 한 번에 검증하는 생성 방식입니다. 주 모델이 제안 토큰 여러 개를 수락하면 한 번의 검증 단계에서 여러 토큰이 출력되어 디코딩 처리량이 높아집니다.
- Distillation
- — 더 큰 Teacher 모델의 능력이나 출력 행동을 작은 Student 모델에 전달하는 학습 방식입니다. 글에서는 Nemotron 3 Ultra의 일부 능력을 더 작은 Nemotron 3.5 Lightning으로 옮기는 과정이 모델 축소의 배경으로 제시됩니다.
- Quantization-Aware Training
- — 낮은 정밀도 연산을 학습 중에 모사해 양자화 뒤의 정확도 저하를 줄이는 방법입니다. 양자화 모델이 애플리케이션의 핵심 행동을 보존하지 못할 때 적용하며, 더 높은 정밀도의 Teacher를 함께 쓰면 Distillation을 결합할 수 있습니다.
기술
- NVIDIA Jetson
- vLLM
- llama.cpp
- NVFP4
- Speculative Decoding
- DSpark
- DFlash2
- MTP
- NVIDIA Model Optimizer
- JetPack 7.2
- Docker
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.