본문으로 건너뛰기
r/LocalLLaMA조회 1

RTX 5060 Ti (Blackwell)에서 vLLM으로 AWQ 모델 실행하기: awq_marlin과 TRITON_ATTN이 핵심

NVIDIA Blackwell 아키텍처 기반 RTX 5060 Ti에서 vLLM을 사용해 AWQ 양자화 모델을 안정적으로 구동하기 위한 특정 플래그 설정 방법과 벤치마크 결과를 공유한다.

실용적 조언

  • vLLM 실행 시 반드시 --quantization awq_marlin과 --attention-backend TRITON_ATTN 플래그를 조합하여 사용할 것
  • Gemma 2 모델 사용 시 'System role not supported' 에러가 발생하면 시스템 프롬프트 필드를 완전히 비울 것
  • Windows 환경이라면 WSL2(Ubuntu)와 최신 버전의 vLLM 개발 빌드를 사용하는 것이 권장됨

섹션별 상세

01
Blackwell 아키텍처(SM_120)는 연산 시 bfloat16 사용을 강제하는 특성이 있어, float16을 요구하는 표준 AWQ 방식 사용 시 pydantic ValidationError와 함께 시스템이 즉시 충돌한다.
bash
vllm serve \
--host 0.0.0.0 \
--port 8000 \
--gpu-memory-utilization 0.90 \
--max-model-len 4096 \
--quantization awq_marlin \
--attention-backend TRITON_ATTN

RTX 5060 Ti에서 AWQ 모델을 안정적으로 실행하기 위한 vLLM 서버 구동 명령어

02
현재 널리 쓰이는 FlashAttention 라이브러리가 아직 SM_120 아키텍처를 공식적으로 지원하지 않기 때문에, vLLM 실행 시 --attention-backend TRITON_ATTN 플래그를 사용하여 Triton 기반 백엔드로 우회해야 정상 작동한다.
03
양자화 옵션으로 --quantization awq_marlin을 설정하는 것이 핵심이며, 이를 통해 Blackwell GPU에서도 AWQ 모델을 안정적으로 로드하고 추론할 수 있음이 확인됐다.
04
Llama 3.1 8B(338ms), Mistral Nemo 12B(437ms), Qwen 2.5 14B(520ms) 등 다양한 모델을 대상으로 테스트한 결과, 모델 크기가 커질수록 첫 토큰 지연 시간이 선형적으로 증가하며 안정적인 성능을 보였다.
05
Gemma 2 모델의 경우 AWQ 로딩은 성공했으나 모델 자체의 템플릿 제한으로 인해 시스템 역할을 지원하지 않으므로, 프론트엔드 설정 시 시스템 프롬프트를 비워두어야 에러를 방지할 수 있다.

용어 해설

블랙웰 아키텍처(Blackwell)
NVIDIA의 최신 GPU 아키텍처로 RTX 50 시리즈의 기반이 되며, bfloat16 연산에 최적화되어 있고 SM_120 연산 능력을 갖추고 있다. 기존 아키텍처와 달리 특정 정밀도를 강제하는 특성이 있어 초기 소프트웨어 호환성 이슈가 발생할 수 있다.
AWQ-마린 커널(AWQ-Marlin)
AWQ 양자화 모델을 Marlin이라는 고성능 추론 커널을 통해 실행하는 방식이다. 특히 최신 NVIDIA GPU에서 FP16/BF16 연산과 4비트 가중치 행렬 곱셈을 효율적으로 처리하여 높은 처리량을 제공한다.
트리톤 어텐션(Triton Attention)
OpenAI의 Triton 프로그래밍 언어로 작성된 어텐션 구현체이다. FlashAttention이 특정 하드웨어나 아키텍처를 아직 지원하지 않을 때 유연한 대안으로 사용되며 하드웨어 가속을 활용한다.
SM_120
NVIDIA Blackwell 아키텍처의 스트리밍 멀티프로세서(SM) 버전을 나타내는 식별자이다. 소프트웨어가 GPU의 기능을 인식하고 최적화된 커널을 선택하는 기준이 된다.

언급된 도구

vLLM추천

고성능 LLM 추론 및 서빙 엔진

Chatbox중립

vLLM API와 연동하여 사용하는 데스크톱용 LLM UI 프론트엔드

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 18.수집 2026. 03. 18.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.