본문으로 건너뛰기

Windows에서 RX 6750 XT용 native vLLM·ROCm 런타임 구축

TheRock 기반 Windows native ROCm 런타임으로 RX 6750 XT에서 vLLM과 Qwen3.5-4B를 실행했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 AMD Radeon RX 6750 XT에서 Windows 11 native HIP·ROCm을 이용해 vLLM을 실행하는 TheRock 기반 런타임과 one-click installer를 만들었습니다. gfx1031용 rocBLAS와 Tensile kernels를 빌드하고 HSA_OVERRIDE_GFX_VERSION=10.3.0으로 HIP 인식 경로를 맞춘 뒤, PyTorch 2.12.0+rocm7.15와 vLLM 0.19.1을 연결했습니다. 4096 크기 FP16 rocBLAS 벤치마크는 25.97 TFLOPS를 기록했고 Qwen3.5-4B 웹 채팅 출력은 59~62 tok/s였지만, 다른 RDNA2 카드와 FP8·AWQ·multi-GPU는 아직 검증되지 않았습니다.

실용적 조언

  • Windows 11 23H2 이상, RX 6600~6750 XT, Adrenalin 24.x 이상, 약 8GB의 여유 디스크 공간을 준비한 뒤 INSTALL.bat를 관리자 권한으로 실행합니다. 설치 프로그램은 C:\TheRock\와 Python 3.11 virtual environment를 만들고 분할 아카이브를 자동으로 결합합니다. 설치가 끝나면 VERIFY.bat로 GPU 감지와 rocBLAS 및 vLLM smoke test를 먼저 실행한 뒤 CHAT.bat를 사용합니다.
  • 다른 RDNA2 카드를 시험할 때는 GPU 모델과 전체 로그를 함께 기록해 저장소 Issue로 제출해야 합니다. 특히 gfx1030·gfx1031·gfx1032의 차이와 HSA_OVERRIDE_GFX_VERSION 설정을 확인하고, 필요하면 해당 gfx 타깃에 맞는 rocBLAS 재빌드를 검토해야 합니다. FP8·AWQ·multi-GPU는 게시물에서 검증되지 않았으므로 운영 환경에 바로 적용하지 않는 편이 안전합니다.

섹션별 상세

01
작성자는 Windows 11에서 AMD RX 6000 Series가 HIP SDK 제외로 Runtime only 취급되는 공백을 메우기 위해 native vLLM과 ROCm 7.15 실행 환경을 구성했습니다. WSL2 래퍼나 별도 컴파일러 없이 Windows의 HIP·ROCm 런타임을 직접 사용하며, 검증 대상은 AMD Radeon RX 6750 XT 12GB와 gfx1031입니다. 구현 결과는 개인 설정 공유를 넘어 AMD RDNA2 카드에서 vLLM을 구동하는 재현 가능한 경로를 제시합니다.
02
ROCm/TheRock가 gfx1031용 HIP 및 rocBLAS와 Tensile 커널을 빌드하고, HSA_OVERRIDE_GFX_VERSION=10.3.0이 HIP의 GPU 인식 경로를 조정합니다. PyTorch 2.12.0+rocm7.15는 TheRock 런타임에 연결되어 torch.cuda.is_available()가 True를 반환하고, vllm_windows_rocm 플러그인은 vllm._C 의존성을 우회해 WinRocmAwqGemvKernel과 TRITON_ATTN을 등록합니다. vLLM 엔진은 enforce_eager=True로 실행되며 torch.compile은 RDNA2 Windows에서 비활성화됩니다.
Windows 명령 프롬프트에서 TheRock 기반 ROCm 경로와 HIP 환경 변수를 설정한 뒤 RX 6750 XT가 HIP runtime 7.15.26290에서 감지된 화면입니다.
Screenshot터미널 로그는 HSA_OVERRIDE_GFX_VERSION=10.3.0, ROCM_PATH, HIP_PATH, ROCBLAS_TENSILE_LIBPATH, PATH를 지정한 후 PyTorch가 GPU를 인식하는 과정을 담고 있습니다. AMD Radeon RX 6750 XT가 표시되고 VRAM은 12.0GB, Compute units는 20으로 출력되어 Windows native 실행 환경의 기본 연결이 확인됩니다.
03
rocBLAS의 4096×4096×4096 FP16 행렬 연산은 25,977.3 Gflops, 즉 25.97 TFLOPS를 5.29ms에 기록했습니다. Qwen3.5-4B를 사용하는 vLLM 웹 채팅에서는 초기화에 약 1초가 걸리고 출력 속도는 59~62 tok/s로 측정됐으며, 이전 수치인 54.2 tok/s보다 높아졌습니다. 다만 이 결과는 RX 6750 XT에서의 검증값이므로 다른 RDNA2 카드에 같은 성능이나 호환성이 보장되지는 않습니다.
rocblas-bench가 RX 6750 XT의 4096 크기 FP16 GEMM에서 25,873.2 Gflops와 5,312.02µs를 기록한 터미널 화면입니다.
Screenshot로그에는 AMD Radeon RX 6750 XT gfx1031, 12.9GB 메모리, rocBLAS 5.7.0.67811f1ee52와 함께 4096×4096×4096 GEMM 측정값이 나타납니다. 본문에 기재된 표 형식의 결과와 연결되는 하드웨어·라이브러리 벤치마크이며, rocBLAS 바이너리가 해당 GPU에서 실제 연산을 수행했는지 확인하는 근거입니다.
vLLM이 프롬프트를 처리하고 Qwen 계열 모델의 답변을 생성하면서 입력 103.91 tok/s와 출력 58.66 tok/s를 기록한 화면입니다.
Screenshot화면에는 두 번의 프롬프트 처리 로그와 함께 생성 시간 8.73초, generated_tokens=512, overall_tok_s=58.64가 표시됩니다. 출력 일부에는 여우·닭·곡식 강 건너기 문제를 단계별로 처리하는 모델 응답이 담겨 있어, 단순 GPU 인식이 아니라 vLLM 추론까지 이어졌음을 확인할 수 있습니다.
04
v2.0에서는 INSTALL.bat가 분할 릴리스 아카이브를 자동으로 내려받아 결합하고 Python 3.11과 virtual environment를 설치하며, CHAT.bat가 OpenAI-compatible API 기반 웹 UI를 엽니다. VERIFY.bat는 GPU 감지, rocBLAS 벤치마크, vLLM smoke test를 한 번에 수행해 설치 뒤 동작 여부를 확인합니다. RX 6600·6600 XT·6700 XT는 아직 테스트되지 않았고 gfx1030에서 10.3.0과 10.3.1 설정 차이 또는 rocBLAS 재빌드가 필요할 수 있습니다.

용어 해설

GPU 선형대수 라이브러리(rocBLAS)
rocBLAS는 AMD GPU에서 행렬 곱셈 같은 BLAS 연산을 수행하는 라이브러리입니다. 이 글에서는 gfx1031용 Tensile 커널을 포함한 바이너리를 빌드해 RX 6750 XT의 FP16 행렬 연산을 vLLM 실행 환경에 연결하는 역할을 합니다.
GPU 아키텍처 타깃 식별자(gfx1031)
gfx1031은 AMD GPU가 사용하는 GPU 아키텍처 및 명령어 타깃 식별자입니다. RX 6750 XT가 Windows용 HIP·ROCm 지원 목록에서 제한되는 문제를 우회하기 위해 HSA_OVERRIDE_GFX_VERSION 값을 지정하고 rocBLAS 커널을 맞춰 빌드하는 데 쓰였습니다.
이식 가능한 GPU 프로그래밍 플랫폼(HIP)
HIP은 GPU 커널을 작성하고 실행하기 위한 AMD의 프로그래밍 플랫폼입니다. 이 구현은 Windows에서 HIP 런타임과 PyTorch ROCm 빌드를 직접 연결해 WSL2 없이 vLLM이 AMD GPU를 인식하도록 구성했습니다.
Tensile 커널(Tensile kernels)
Tensile kernels는 AMD GPU의 행렬 연산을 위한 최적화된 커널 집합입니다. 글에서는 gfx1031에 맞는 rocBLAS 바이너리를 만들고 RDNA2의 gfx1030·gfx1031·gfx1032를 하나의 fat-binary로 묶어 카드별 재빌드를 줄이는 데 활용했습니다.
즉시 실행 모드(enforce_eager=True)
enforce_eager=True는 vLLM 엔진이 그래프 컴파일이나 지연 실행 대신 즉시 연산 경로를 사용하도록 하는 설정입니다. RDNA2 Windows 환경에서는 torch.compile이 비활성화되어야 하므로 이 옵션을 켜야 vLLM 엔진이 실행됩니다.

언급된 도구

vLLM추천

Windows native 환경에서 Qwen3.5-4B를 실행하고 OpenAI-compatible API와 웹 채팅 UI를 제공하는 추론 엔진입니다.

ROCm/TheRock추천

gfx1031용 HIP 및 rocBLAS 실행 바이너리와 Tensile kernels를 빌드하는 기반입니다.

PyTorch중립

ROCm 7.15 런타임에 연결되어 AMD GPU 인식과 torch.cuda.is_available() 확인을 담당합니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 18.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.