본문으로 건너뛰기
r/LocalLLaMA조회 2

RTX 5090에서 vLLM을 이용한 Nemotron 추론 벤치마크 및 설정 가이드

RTX 5090 환경에서 vLLM을 사용하여 Nemotron 모델을 BF16으로 구동한 벤치마크 결과와 주요 설정 오류 해결 방법을 공유한다.

커뮤니티 반응

RTX 5090의 실제 추론 성능 수치에 대해 긍정적인 반응이며, 특히 Mamba 하이브리드 모델 설정 팁이 유용하다는 평가가 많다.

실용적 조언

  • vLLM에서 Mamba 모델 구동 시 --mamba_ssm_cache_dtype float32 옵션을 반드시 추가하여 정확도 저하를 방지해야 한다.
  • 추론(Reasoning) 기능을 사용할 때는 max_tokens를 1024 이상으로 설정하여 생각 토큰이 전체 할당량을 차지하지 않도록 주의해야 한다.

섹션별 상세

RTX 5090의 BF16 추론 성능 결과가 공개됐다. 양자화 없이 단일 요청 시 초당 약 83토큰, 10개 동시 요청 시 초당 약 630토큰의 처리량을 기록했다. TTFT는 45-60ms 수준이며, 32GB VRAM 중 30.6GB를 점유하여 거의 최대 용량을 사용하는 것으로 나타났다.
vLLM 0.15.1 버전의 HuggingFace 추론 파서 플러그인에서 임포트 오류가 발견됐다. 특정 버전에서 발생하는 이 버그는 블로그 포스트에 제시된 수정 방법을 통해 해결이 가능하다.
추론(Reasoning) 기능 활성화 시 max_tokens 설정의 중요성이 확인됐다. max_tokens를 1024 미만으로 설정하면 모델의 생각(Thinking) 토큰이 할당된 예산을 모두 소모하여 실제 응답 내용이 null로 반환되는 현상이 발생한다.
Mamba 하이브리드 모델의 정확도 유지 설정이 필수적이다. --mamba_ssm_cache_dtype float32 옵션을 사용하지 않을 경우 추론 결과의 정확도가 급격히 저하되는 문제가 보고됐다.
bash
--mamba_ssm_cache_dtype float32

Mamba 하이브리드 모델의 추론 정확도 저하를 방지하기 위해 필수적으로 추가해야 하는 vLLM 실행 옵션이다.

Mamba 하이브리드 모델 아키텍처를 다룰 때 TRT-LLM 대신 vLLM을 선택한 배경이 언급됐다. 이는 특정 모델 구조에 대한 엔진별 지원 수준과 최적화 편의성을 고려한 결과이다.

용어 해설

첫 토큰 생성 시간(TTFT)
사용자의 요청 후 모델이 첫 번째 토큰을 출력하기까지 걸리는 지연 시간이다. 실시간 상호작용의 쾌적함을 결정하는 핵심 지표로, 이 수치가 낮을수록 사용자는 반응이 빠르다고 느낀다.
Bfloat16(BF16)
구글이 개발한 16비트 부동소수점 형식으로, FP32와 동일한 지수 범위를 가져 학습 및 추론 시 수치 안정성이 높다. 메모리 사용량을 절반으로 줄이면서도 모델의 정확도 손실을 최소화한다.
맘바 상태 공간 모델(Mamba SSM)
트랜스포머의 어텐션 메커니즘 대신 상태 공간 모델(SSM)을 사용하여 선형적 시간 복잡도로 긴 문맥을 처리하는 아키텍처이다. 추론 속도가 빠르고 메모리 효율이 뛰어나 차세대 모델 구조로 주목받는다.
비디오 램(VRAM)
그래픽 카드에 탑재된 전용 메모리로, LLM 구동 시 모델의 가중치와 활성화 함수 데이터를 저장하는 공간이다. 모델의 크기와 컨텍스트 길이에 따라 필요한 VRAM 용량이 결정된다.

언급된 도구

vLLM추천

LLM 추론 및 서빙 엔진

RTX 5090추천

고성능 그래픽 카드 하드웨어

Nemotron중립

NVIDIA에서 개발한 대형 언어 모델

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 16.수집 2026. 03. 16.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.