본문으로 건너뛰기

NVIDIA Jetson에서 추론 모델 배포와 최적화

NVFP4와 Speculative Decoding으로 Jetson에서 추론 모델 처리량을 높이는 배포 구성

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

2026년에 공개된 소형 Open 모델은 대규모 데이터센터 모델에 가까운 추론·에이전트 기능을 제공하며 Jetson에서 로컬 실행이 가능해졌습니다. Nemotron 3.5 Lightning은 전체 300억 개 중 토큰마다 30억 개 파라미터만 활성화하는 Mixture-of-Experts 구조이고, Qwen3.8-27B는 270억 개 전체를 활성화하는 Dense 구조라 작업별 선택 기준이 다릅니다. NVFP4 양자화는 각 디코딩 단계의 데이터 이동과 메모리 부담을 줄이고, Speculative Decoding은 Draft 모델의 여러 토큰을 주 모델이 함께 검증해 처리량을 높입니다. 테스트 환경에서는 두 기법을 결합해 BF16 대비 최대 6.28배의 디코드 처리량 향상이 확인됐지만, 최적 방식은 Nemotron 3.5 Lightning에서 DSpark, Qwen3.8-27B에서 DFlash2로 달랐습니다. 실제 애플리케이션의 프롬프트와 데이터로 정확도, 토큰 수락률, 처리량을 함께 측정해야 배포 구성을 결정할 수 있습니다.

빠른 이해

새로운 점

2026년 소형 Open 모델을 Jetson에서 NVFP4와 모델별 Speculative Decoding 조합으로 실행하고, 애플리케이션 프롬프트 기준까지 포함한 검증 절차를 제시합니다.

핵심 메커니즘

BF16 기준 모델에 NVFP4 양자화를 적용해 각 디코딩 단계의 데이터 이동·메모리 비용을 줄인 뒤, Draft 모델이 제안한 여러 토큰을 주 모델이 한 번에 검증하는 Speculative Decoding을 결합합니다. Nemotron 3.5 Lightning에는 DSpark, Qwen3.8-27B에는 DFlash2를 연결하고, vLLM에서 모델별 체크포인트·토큰 수·메모리 설정을 지정해 로컬 추론 처리량을 높입니다.

핵심 수치

  • BF16 대비 최대 디코드 처리량 향상: 최대 6.28배- Jetson에서 NVFP4와 모델별 최적 Speculative Decoding 구성을 결합한 결과
  • Nemotron 3.5 Lightning 출력 처리량: 123.01~138.02 output tokens/s- DSpark 구성으로 writing, reasoning, summarization, RAG 범주 측정
  • Qwen3.8-27B 출력 처리량: 27.69~34.44 output tokens/s- DFlash2 구성으로 writing, reasoning, summarization, RAG 범주 측정
  • Nemotron 3.5 Lightning 활성 파라미터: 전체 30B 중 토큰당 3B- Mixture-of-Experts 구조
  • Qwen3.8-27B 활성 파라미터: 토큰당 27B 전체- Dense 구조

섹션별 상세

01

Jetson 에지 추론의 전환점

최근까지 다단계 추론과 에이전트 기능을 갖춘 모델은 엣지 장치에서 실행하기 어려워 데이터센터 추론과 네트워크 연결에 의존했습니다. 2026년에 공개된 소형 Open 모델은 더 적은 파라미터로 2025년 주요 모델과 비슷한 Artificial Analysis Intelligence Index 점수에 도달했고, Jetson에서 로컬 실행이 가능해졌습니다. 로컬 에이전트는 센서 데이터와 장치 로그를 읽고 승인된 조치를 수행한 뒤 사전 정의된 테스트로 결과를 확인하는 흐름을 네트워크 없이 처리합니다. 이 구조는 차량 내 보조 기능, 실시간 이상 감지, 원격 환경의 로봇처럼 지연과 연결성의 영향을 크게 받는 작업에 적용할 기반을 제공합니다.
02

모델 구조에 따른 선택 기준

Nemotron 3.5 Lightning은 Nemotron 3 Ultra의 일부 능력을 Distillation으로 옮긴 Mixture-of-Experts 모델로, 전체 300억 개 파라미터 중 토큰마다 30억 개만 활성화합니다. 반면 Qwen3.8-27B는 Dense 모델이므로 토큰마다 270억 개 파라미터 전체를 활성화하며 메모리 사용과 생성 속도에서 다른 특성을 보입니다. 빠른 응답을 반복해야 하는 장시간 에이전트 루프에서는 Nemotron 3.5 Lightning이 적합하고, 결정 횟수는 적지만 각 응답에 더 많은 생성 시간이 필요한 작업에는 Qwen3.8-27B가 맞습니다. 최종 선택은 모델 이름만으로 정하지 않고 애플리케이션의 결정, 도구 호출, 응답 패턴을 포함한 벤치마크로 판단해야 하며, Jetson에서는 vLLM과 llama.cpp를 통한 로컬 배포가 가능합니다.
03

NVFP4와 Speculative Decoding

Jetson의 토큰 생성은 보통 토큰마다 모델을 다시 통과하므로, 한 단계의 연산량을 줄이거나 한 단계에서 더 많은 토큰을 생성하는 방식으로 최적화할 수 있습니다. NVFP4 양자화는 낮은 정밀도의 값을 사용해 GPU가 이동·처리하는 데이터와 메모리 사용량을 줄이고, Speculative Decoding은 작은 Draft 모델이 여러 토큰을 제안한 뒤 주 모델이 함께 검증하도록 구성합니다. 주 모델이 제안 토큰 여러 개를 수락하면 한 번의 검증 단계에서 생성이 여러 토큰씩 진행되며, 두 기법을 결합한 구성은 BF16 대비 최대 6.28배의 디코드 처리량 향상을 기록했습니다. 테스트에서 Nemotron 3.5 Lightning의 최적 조합은 DSpark였고 Qwen3.8-27B의 최적 조합은 DFlash2였으므로 모델별 실험이 필요합니다.
bash
docker run --pull=always --runtime nvidia --rm -it \\--network host \\--ipc=host \\-v ~/.cache/huggingface:/root/.cache/huggingface \\--entrypoint bash \\vllm/vllm-openai:v0.28.0

NVIDIA Container Runtime이 설정된 Jetson에서 vLLM OpenAI 컨테이너를 실행합니다.

bash
vllm serve nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4 \\ --reasoning-parser nemotron_v3 \\ --enable-auto-tool-choice \\ --tool-call-parser qwen3_coder \\ --max-model-len 128000 \\ --kv-cache-dtype fp8 \\ --gpu-memory-utilization 0.7 \\ --trust-remote-code \\ --max-num-batched-tokens 16384 \\ --enable-prefix-caching \\ --speculative-config '{"method":"dspark","model":"nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-NVFP4-DSpark","num_speculative_tokens":5}' \\ --mamba-backend flashinfer \\ --mamba-ssm-cache-dtype float16 \\ --enable-mamba-cache-stochastic-rounding \\ --mamba-cache-philox-rounds 5 \\ --mamba-cache-mode align

NVFP4와 DSpark를 결합한 Nemotron 3.5 Lightning 서빙 설정을 vLLM에 전달합니다.

bash
VLLM_GDN_DECODE_KERNEL=triton vllm serve Inferact/Qwen3.8-27B-NVFP4 \\ --served-model-name qwen38 \\ --reasoning-parser qwen3 \\ --enable-auto-tool-choice \\ --tool-call-parser qwen3_coder \\ --max-model-len 50000 \\ --max-num-seqs 8 \\ --gpu-memory-utilization 0.85 \\ --trust-remote-code \\ --speculative-config '{"method":"dflash","model":"incoai/Qwen3.8-27B-DFlash2","num_speculative_tokens":7}'

NVFP4와 DFlash2를 결합한 Qwen3.8-27B 서빙 설정을 vLLM으로 실행합니다.

04

vLLM 배포 설정과 Draft 방식

Nemotron 3.5 Lightning은 Jetson AGX Thor 또는 Jetson AGX Orin에서 NVFP4 체크포인트와 DSpark Draft 체크포인트를 vLLM으로 함께 실행하며, 명령에는 reasoning parser, 자동 도구 선택, FP8 KV cache, prefix caching, 5개 speculative token 설정이 포함됩니다. Qwen3.8-27B는 같은 컨테이너에서 NVFP4 체크포인트와 DFlash2를 사용하고, 최대 모델 길이 50000, 최대 시퀀스 8, GPU 메모리 사용률 0.85, 7개 speculative token을 지정합니다. MTP는 주 모델과 함께 학습한 Prediction Head로 미래 토큰을 제안하고, DFlash는 Diffusion 기반 별도 Draft 모델로 토큰 블록을 병렬 제안하며, DSpark는 DFlash의 제안을 보정하고 약한 제안을 일찍 중단합니다. 실행 전 JetPack 7.2, NVIDIA Container Runtime, Docker, 모델·Draft 체크포인트 저장 공간, Nemotron 및 Qwen 라이선스 승인이 필요합니다.
05

실제 작업 기준의 성능 검증

모델 수준 벤치마크는 유망한 Speculative Decoding 구성을 찾는 출발점이지만, 애플리케이션이 생성하는 텍스트 유형에 따라 처리량이 달라집니다. 네 가지 SpeedBench 범주를 고정 구성으로 측정한 결과 Nemotron 3.5 Lightning과 DSpark는 초당 123.01~138.02 출력 토큰, Qwen3.8-27B와 DFlash2는 초당 27.69~34.44 출력 토큰 범위를 기록했습니다. 두 모델 모두 테스트 범주에서 같은 방식이 가장 빨랐지만, RAG와 writing에서 두 모델의 속도 향상이 가장 컸고 작업별 처리량 자체는 달랐습니다. 따라서 배포 전 대표 프롬프트로 정확도와 처리량을 측정하고, Draft 토큰 수락률이 낮아 속도 이득이 줄어들 때만 Speculator 학습이나 양자화 인식 학습을 고려해야 합니다.

용어 해설

Mixture-of-Experts
여러 전문가 모듈 중 일부만 선택해 토큰을 처리하는 모델 구조입니다. Nemotron 3.5 Lightning은 전체 300억 개 파라미터를 보유하지만 토큰마다 30억 개만 활성화해 연산량과 생성 속도 측면에서 Dense 모델과 다른 특성을 만듭니다.
NVFP4 양자화(NVFP4 Quantization)
모델 가중치와 연산 값을 낮은 정밀도로 표현해 GPU가 이동·처리해야 할 데이터 양을 줄이는 최적화 기법입니다. Jetson에서는 BF16 대비 메모리 사용량과 토큰별 처리 비용을 낮추면서 생성 품질을 가깝게 유지하는 데 쓰입니다.
추측 디코딩(Speculative Decoding)
작은 Draft 모델이 여러 토큰을 먼저 제안하고 주 모델이 이를 한 번에 검증하는 생성 방식입니다. 주 모델이 제안 토큰 여러 개를 수락하면 한 번의 검증 단계에서 여러 토큰이 출력되어 디코딩 처리량이 높아집니다.
Distillation
더 큰 Teacher 모델의 능력이나 출력 행동을 작은 Student 모델에 전달하는 학습 방식입니다. 글에서는 Nemotron 3 Ultra의 일부 능력을 더 작은 Nemotron 3.5 Lightning으로 옮기는 과정이 모델 축소의 배경으로 제시됩니다.
Quantization-Aware Training
낮은 정밀도 연산을 학습 중에 모사해 양자화 뒤의 정확도 저하를 줄이는 방법입니다. 양자화 모델이 애플리케이션의 핵심 행동을 보존하지 못할 때 적용하며, 더 높은 정밀도의 Teacher를 함께 쓰면 Distillation을 결합할 수 있습니다.

기술

  • NVIDIA Jetson
  • vLLM
  • llama.cpp
  • NVFP4
  • Speculative Decoding
  • DSpark
  • DFlash2
  • MTP
  • NVIDIA Model Optimizer
  • JetPack 7.2
  • Docker

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

수집 2026. 09. 05.출처 타입 WEB

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.