본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

weicj/vLLM-2080Ti-Definitive

Python1 / 0

dual RTX 2080 Ti와 NVLink에서 Qwen3.x 27B를 고속 구동하는 vLLM runtime fork입니다.

TL;DR

이 레포지토리는 vLLM 0.21.0을 기반으로 dual RTX 2080 Ti 22GB와 NVLink에서 Qwen3.x 27B·35B를 실행하도록 패치와 프로필을 묶은 하드웨어 특화 runtime fork입니다. `build.sh`가 Python 환경과 CUDA extensions를 구성하고 `launcher.sh`가 모델·프로필·KV precision·MTP·API 서버 설정을 관리합니다. Qwen3.6·Qwen3.8 27B FP8 단일 요청 decode에서 100+ tok/s가 검증됐지만, 처리 구조는 다중 테넌트보다 단일 동시성 작업에 맞춰져 있습니다. 동일한 GPU·CUDA·PyTorch·NVLink 조건을 갖춘 개발자라면 검토할 가치가 높고, 다른 하드웨어에서는 별도 검증이 필요합니다.

핵심 포인트

  • 이 레포지토리는 독립형 애플리케이션이 아니라 vLLM 0.21.0을 기반으로 한 NVIDIA Turing용 하드웨어 특화 runtime fork입니다. dual RTX 2080 Ti 22GB와 NVLink, SM75, tensor parallel size 2 환경에서 Qwen3.x 27B·35B 모델을 구동하는 데 초점을 둡니다. 일반적인 vLLM 설치본보다 특정 GPU 조합의 패치, CUDA 확장, 실행 프로필과 운영 절차를 함께 고정한 형태입니다.
  • 빌드 과정은 `build.sh`가 `.venv`와 의존성을 만들고 CUDA extensions를 컴파일한 뒤, `launcher.sh`가 모델 경로·프로필·모드·GPU·포트·접근 범위를 설정해 OpenAI-compatible API 서버를 실행하는 흐름입니다. `safe`, `normal`, `fast`, `aggressive` 프로필을 제공하고 비대화형 실행에서는 환경 변수로 모델과 프로필을 지정합니다. Prefix cache, tool calling, chat template, MTP와 KV precision 설정까지 런처에서 관리하므로 수동 플래그 조합을 줄일 수 있습니다.
  • 공식 Qwen3.6·Qwen3.8 27B FP8 경로에서 단일 요청 decode 100+ tok/s가 검증됐고, Qwen3.x 35B는 text-only 256K, text+image 136K, MTP3 fast 178K 경로를 기록했습니다. 구현에는 Marlin, FlashQLA·FlashInfer, TurboQuant·INT8 KV, MTP, CUDAGraph 통합이 포함됩니다. 다만 다중 테넌트 병렬 처리보다는 한 번에 하나의 개인 에이전트형 요청을 처리하는 단일 동시성 성능에 맞춰져 있어 서비스 목적을 먼저 확인해야 합니다.
  • 검증 기준은 Ubuntu 22.04·24.04 LTS 또는 Debian 12, Linux kernel 6.x, CUDA 12.8, `torch 2.11.0+cu128`, dual RTX 2080 Ti 22GB와 NVLink입니다. PCIe P2P만으로 동작할 가능성은 있으나 좁은 PCIe 링크 조합은 검증 대상이 아니며, 혼합 11GB·22GB 카드도 27B급 프로필에는 권장되지 않습니다. 이 조건과 다른 GPU·드라이버·CUDA 조합이라면 프로필과 P2P·KV dtype·CUDAGraph 동작을 별도로 벤치마크해야 합니다.

벤치마크

벤치마크지표비교
Qwen3.6 27B FP8 단일 요청 decodethroughput100+ tok/s
vLLM 2080 Ti Speed Chat prefillthroughput574.31 tok/s
vLLM 2080 Ti Speed Chat decodethroughput93.24 tok/s
vLLM 2080 Ti Speed Chat 생성 토큰generated tokens1566
vLLM 2080 Ti Speed Chat E2Ewall time16.880s

이미지 분석

vLLM 2080 Ti Speed Chat 화면에서 prefill 574.31 tok/s, decode 93.24 tok/s, 생성 토큰 1566개, E2E 16.880초를 표시한 실행 결과입니다.
화면은 OpenAI-compatible 채팅형 서비스의 실행 결과와 함께 prefill speed, decode speed, generated tokens, E2E wall time을 실시간 지표로 표시합니다. 입력 예시는 HTML snake game code 생성 요청이며, 단일 요청 처리 성능을 확인하는 데 필요한 측정 항목과 런타임 사용 방식을 함께 보여줍니다.

666

STARS

102

FORKS

+208

TRENDING

1

조회수

watchers 666open issues 22Apache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.