본문으로 건너뛰기

NVIDIA Jetson에서 vLLM을 활용한 Cosmos Reason 2B 시각 언어 모델 배포 가이드

NVIDIA Jetson 장치에서 vLLM 프레임워크를 사용하여 Cosmos Reason 2B 모델을 배포하고 실시간 웹캠 분석 시스템을 구축하는 기술적 절차를 제시한다.

섹션별 상세

01
NVIDIA Jetson AGX Thor, AGX Orin, Orin Nano Super 등 하드웨어 라인업에 따른 JetPack 버전과 저장 공간 요구사항을 정의한다. AGX Thor는 JetPack 7을, Orin 시리즈는 JetPack 6를 기반으로 하며 모델 가중치와 컨테이너 이미지를 위해 약 13GB 이상의 NVMe SSD 공간이 필요하다.
02
NGC CLI를 설치하고 API 키를 설정하여 NVIDIA NGC 카탈로그에서 FP8로 양자화된 Cosmos Reason 2B 모델 체크포인트를 다운로드한다. 이 과정에서 다운로드된 모델 경로를 이후 Docker 컨테이너 실행 시 볼륨으로 마운트하여 사용한다.
bash
ngc registry model download-version "nim/nvidia/cosmos-reason2-2b:1208-fp8-static-kv8"

NGC CLI를 사용하여 FP8로 양자화된 Cosmos Reason 2B 모델 체크포인트를 다운로드하는 명령어

03
각 장치별로 최적화된 vLLM Docker 이미지를 가져와 실행하며, 컨테이너 내부에서 vllm serve 명령어를 통해 모델을 서빙한다. AGX Thor와 Orin 64GB 모델은 8192 토큰의 충분한 컨텍스트 길이를 지원하며, --reasoning-parser qwen3 플래그를 통해 사고의 사슬(CoT) 추론 결과를 추출할 수 있다.
bash
vllm serve /models/cosmos-reason2-2b \
  --max-model-len 8192 \
  --media-io-kwargs '{"video": {"num_frames": -1}}' \
  --reasoning-parser qwen3 \
  --gpu-memory-utilization 0.8

Jetson AGX Thor 또는 Orin에서 충분한 컨텍스트 길이와 함께 vLLM 서버를 실행하는 설정

04
메모리가 제한된 Orin Nano Super 환경을 위해 공격적인 최적화 설정을 적용한다. --enforce-eager 플래그로 CUDA 그래프 점유 메모리를 해제하고, 컨텍스트 길이를 256으로 제한하며, --gpu-memory-utilization을 0.65로 낮추어 시스템 프로세스를 위한 여유 공간을 확보한다.
bash
vllm serve /models/cosmos-reason2-2b \
  --enforce-eager \
  --max-model-len 256 \
  --gpu-memory-utilization 0.65 \
  --max-num-seqs 1 \
  --enable-chunked-prefill \
  --VLLM_SKIP_WARMUP=true

메모리가 제한된 Orin Nano Super를 위해 CUDA 그래프를 끄고 컨텍스트를 제한하는 최적화 실행 설정

05
배포된 vLLM 서버를 Live VLM WebUI와 연결하여 실시간 웹캠 분석 시스템을 완성한다. WebUI 설정에서 API 베이스 URL을 vLLM 엔드포인트로 지정하고, 프레임 처리 간격을 조정하여 엣지 디바이스의 연산 부하를 관리하면서 실시간 시각 추론 결과를 브라우저에서 확인할 수 있다.
bash
curl -s http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "/models/cosmos-reason2-2b",
    "messages": [ { "role": "user", "content": "What capabilities do you have?" } ],
    "max_tokens": 128
  }' | python3 -m json.tool

배포된 vLLM 서버가 정상적으로 응답하는지 확인하기 위한 API 호출 테스트

용어 해설

시각 언어 모델(VLM)
이미지나 비디오 같은 시각적 정보와 텍스트 데이터를 동시에 처리하고 이해할 수 있는 멀티모달 인공지능 모델이다. 고정된 레이블을 넘어 자연어를 통해 복잡하고 개방적인 환경을 해석하고 추론할 수 있어 로보틱스 및 물리적 AI 분야에서 핵심적인 역할을 수행한다.
8비트 부동소수점 양자화(FP8 Quantization)
모델의 가중치와 활성화 함수를 8비트 부동소수점 형식으로 변환하여 정밀도를 최대한 유지하면서 메모리 사용량을 줄이고 연산 속도를 높이는 기법이다. 엣지 디바이스처럼 자원이 제한된 환경에서 대규모 모델을 효율적으로 실행하기 위해 필수적으로 사용된다.
사고의 사슬(Chain-of-Thought)
모델이 복잡한 문제에 대해 최종 결론을 내리기 전 논리적인 중간 추론 단계를 생성하도록 유도하는 기법이다. 이를 통해 모델의 추론 과정을 투명하게 확인할 수 있으며, 특히 시각적 상황 분석 시 더 정확하고 상세한 결과를 얻을 수 있다.
젯팩(JetPack)
NVIDIA Jetson 플랫폼에서 AI 애플리케이션을 구축하기 위한 소프트웨어 개발 키트(SDK)이다. 운영체제(L4T), CUDA 라이브러리, TensorRT, cuDNN 등 하드웨어 가속을 위한 핵심 구성 요소를 포함하여 엣지 AI 개발 환경을 제공한다.
쿠다 그래프(CUDA Graph)
GPU 연산 작업들을 하나의 그래프 형태로 정의하여 실행 오버헤드를 줄이는 기술이다. 하지만 그래프 생성 과정에서 상당한 양의 GPU 메모리를 미리 점유하기 때문에, 메모리가 극도로 제한된 환경에서는 이를 비활성화하여 가용 메모리를 확보하기도 한다.

기술

  • vLLM
  • NVIDIA Cosmos Reason 2B
  • Docker
  • NGC CLI
  • Live VLM WebUI
  • CUDA
  • Python

활용 사례

  • 실시간 웹캠 영상 분석
  • 로봇 시각 추론 시스템
  • 엣지 기반 물리적 AI 프로토타이핑
  • 저전력 환경의 멀티모달 대화 시스템
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 24.수집 2026. 02. 24.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.