weicj/vLLM-2080Ti-Definitive
Python1 / 0
dual RTX 2080 Ti와 NVLink에서 Qwen3.x 27B를 고속 구동하는 vLLM runtime fork입니다.
TL;DR
이 레포지토리는 vLLM 0.21.0을 기반으로 dual RTX 2080 Ti 22GB와 NVLink에서 Qwen3.x 27B·35B를 실행하도록 패치와 프로필을 묶은 하드웨어 특화 runtime fork입니다. `build.sh`가 Python 환경과 CUDA extensions를 구성하고 `launcher.sh`가 모델·프로필·KV precision·MTP·API 서버 설정을 관리합니다. Qwen3.6·Qwen3.8 27B FP8 단일 요청 decode에서 100+ tok/s가 검증됐지만, 처리 구조는 다중 테넌트보다 단일 동시성 작업에 맞춰져 있습니다. 동일한 GPU·CUDA·PyTorch·NVLink 조건을 갖춘 개발자라면 검토할 가치가 높고, 다른 하드웨어에서는 별도 검증이 필요합니다.
핵심 포인트
- 이 레포지토리는 독립형 애플리케이션이 아니라 vLLM 0.21.0을 기반으로 한 NVIDIA Turing용 하드웨어 특화 runtime fork입니다. dual RTX 2080 Ti 22GB와 NVLink, SM75, tensor parallel size 2 환경에서 Qwen3.x 27B·35B 모델을 구동하는 데 초점을 둡니다. 일반적인 vLLM 설치본보다 특정 GPU 조합의 패치, CUDA 확장, 실행 프로필과 운영 절차를 함께 고정한 형태입니다.
- 빌드 과정은 `build.sh`가 `.venv`와 의존성을 만들고 CUDA extensions를 컴파일한 뒤, `launcher.sh`가 모델 경로·프로필·모드·GPU·포트·접근 범위를 설정해 OpenAI-compatible API 서버를 실행하는 흐름입니다. `safe`, `normal`, `fast`, `aggressive` 프로필을 제공하고 비대화형 실행에서는 환경 변수로 모델과 프로필을 지정합니다. Prefix cache, tool calling, chat template, MTP와 KV precision 설정까지 런처에서 관리하므로 수동 플래그 조합을 줄일 수 있습니다.
- 공식 Qwen3.6·Qwen3.8 27B FP8 경로에서 단일 요청 decode 100+ tok/s가 검증됐고, Qwen3.x 35B는 text-only 256K, text+image 136K, MTP3 fast 178K 경로를 기록했습니다. 구현에는 Marlin, FlashQLA·FlashInfer, TurboQuant·INT8 KV, MTP, CUDAGraph 통합이 포함됩니다. 다만 다중 테넌트 병렬 처리보다는 한 번에 하나의 개인 에이전트형 요청을 처리하는 단일 동시성 성능에 맞춰져 있어 서비스 목적을 먼저 확인해야 합니다.
- 검증 기준은 Ubuntu 22.04·24.04 LTS 또는 Debian 12, Linux kernel 6.x, CUDA 12.8, `torch 2.11.0+cu128`, dual RTX 2080 Ti 22GB와 NVLink입니다. PCIe P2P만으로 동작할 가능성은 있으나 좁은 PCIe 링크 조합은 검증 대상이 아니며, 혼합 11GB·22GB 카드도 27B급 프로필에는 권장되지 않습니다. 이 조건과 다른 GPU·드라이버·CUDA 조합이라면 프로필과 P2P·KV dtype·CUDAGraph 동작을 별도로 벤치마크해야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Qwen3.6 27B FP8 단일 요청 decode | throughput | 100+ tok/s | — |
| vLLM 2080 Ti Speed Chat prefill | throughput | 574.31 tok/s | — |
| vLLM 2080 Ti Speed Chat decode | throughput | 93.24 tok/s | — |
| vLLM 2080 Ti Speed Chat 생성 토큰 | generated tokens | 1566 | — |
| vLLM 2080 Ti Speed Chat E2E | wall time | 16.880s | — |
이미지 분석

666
STARS
102
FORKS
+208
TRENDING
1
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.