본문으로 건너뛰기
r/LocalLLaMA조회 1

16개 RTX 5060 Ti로 1M context 추론 구성

PLX 스위치와 BAR1 튜닝으로 16개 RTX 5060 Ti를 긴 context 추론 클러스터로 구성했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 두 개의 Broadcom/PLX PEX88096 스위치 섬에 16 x RTX 5060 Ti 16 GB를 연결하고, patched NVIDIA driver와 GPU별 16,384 MiB BAR1 설정을 적용했다. PLX 클러스터 내부 custom all-reduce와 DSpark pipeline parallel 연동을 추가해 Tensor Parallel 8·Pipeline Parallel 2에서 최대 500k context, 약 4,000 prompt tokens/s와 100~150 generation tokens/s를 기록했다. Tensor Parallel 4·Pipeline Parallel 4에서는 1M context와 약 7,000 prompt tokens/s, generation 80 tokens/s를 제시했으며, 화면에는 각 GPU의 15 GiB 이상 메모리 점유와 VLLM worker 분산 상태가 나타난다.

주요 논점

01찬성소수

16개의 RTX 5060 Ti를 PCIe 스위치와 patched NVIDIA driver로 묶어 긴 context 추론 및 높은 prompt 처리량을 확보한 구성이 실용적인 비용 대안이라는 입장이다.

02중립소수

제시된 수치는 구체적이지만 custom all-reduce, DSpark, patched driver에 의존하므로 다른 시스템에서 동일한 성능과 안정성을 재현할지는 별도 검증이 필요하다는 입장이다.

합의점 vs 논쟁점

합의점

  • 구성에는 16개 RTX 5060 Ti, 16,384 MiB BAR1, PLX PEX88096 스위치 두 개, patched NVIDIA driver가 함께 사용됐다. 긴 context를 목표로 Tensor Parallel과 Pipeline Parallel을 조합했고 VLLM worker가 여러 GPU에 분산됐다.

논쟁점

  • 게시물은 custom all-reduce와 DSpark 연동을 구체적인 코드나 재현 절차 없이 간단히 설명한다. 따라서 제시된 prompt·generation 처리량이 GPU 구성 자체의 효과인지 통신 최적화와 특정 harness의 영향인지 분리하기 어렵다.

실용적 조언

  • 동일한 구성을 재현하려면 UEFI 부팅과 CSM·Secure Boot 비활성화, Above 4G Decoding, MMIO High Granularity 1024G, MMIO High Base 약 56T를 먼저 맞춰야 한다. GRUB에는 intel_iommu=off pci=realloc=on,hpmmioprefsize=512G를 적용하고 NVIDIA 모듈에서는 NVreg_EnableResizableBar=1을 설정해야 한다. 이후 각 GPU의 BAR1이 16,384 MiB로 잡히는지와 PLX 브리지 ACS 설정을 확인한 뒤 병렬화별 처리량을 따로 측정해야 한다.

섹션별 상세

01
작성자는 ASRock Rack SPC621D8U-2T/OVH와 Xeon Gold 6330, 두 개의 Broadcom/PLX PEX88096 스위치 섬에 각각 8개 GPU를 연결해 16 x RTX 5060 Ti 16 GB 시스템을 구성했다. Ubuntu 22.04.5 LTS와 커널 6.8.0-106-generic에서 Aikitoria patched open driver 610.43.02-p2p를 사용했고, 각 GPU에 16,384 MiB BAR1을 할당했다. UEFI·Above 4G Decoding·대규모 MMIO 영역과 GRUB의 pci=realloc 설정을 함께 적용해 PCIe 주소 공간을 확보한 점이 핵심이다.
02
GPU 수를 늘리는 데 그치지 않고 PLX 브리지의 ACS 제어 레지스터를 수정한 뒤, 각 PLX 클러스터 내부에서 동작하는 custom all-reduce와 pipeline parallel용 DSpark 연동을 추가했다. Tensor Parallel 8과 Pipeline Parallel 2 조합에서는 최대 500k context가 가능했고, 약 4,000 prompt tokens/s와 100~150 generation tokens/s를 기록했으며 DeepSeek Harness 평균 generation 속도는 140 tokens/s였다. Tensor Parallel 4와 Pipeline Parallel 4 조합에서는 1M context와 약 7,000 prompt tokens/s, 최대 500k context에서 generation 80 tokens/s를 제시했다.
03
구성 전체의 비용은 RTX6000 Pro 0.6장 수준으로 표현됐지만, 게시물의 성능 수치는 16개 GPU와 특정 patched driver·PCIe 스위치 설정·병렬화 조합에 종속된다. 첨부 화면에는 각 GPU가 약 15.2~15.7 GiB의 메모리를 사용하고 VLLM::Worker 프로세스가 여러 GPU에 배치된 상태가 보인다. 따라서 이 사례의 의미는 단일 GPU 성능보다 저가 GPU 여러 장을 BAR1 재할당과 클러스터별 통신 최적화로 묶어 긴 context 추론에 활용한 구현 경로에 있다.

이미지 분석

16개 NVIDIA GeForce RTX 5060 Ti의 상태와 VLLM worker별 GPU 메모리 사용량을 표시한 터미널 화면이다.
Screenshot

화면 상단에는 Device 0부터 Device 15까지 RTX 5060 Ti가 나열되고, 각 GPU의 메모리 사용량이 대체로 15.2~15.7 GiB/15.929 GiB로 표시된다. 하단 프로세스 목록에는 VLLM::Worker_PP1_TP6 같은 worker가 여러 GPU에 배치되어 있어, 모델 추론 작업이 GPU 클러스터 전반에 분산된 상태를 확인할 수 있다. 본문이 제시한 다중 GPU 추론 구성과 실제 메모리 점유 상태를 연결하는 자료다.

16개 NVIDIA GeForce RTX 5060 Ti의 상태와 VLLM worker별 GPU 메모리 사용량을 표시한 터미널 화면이다.

16개 RTX 5060 Ti의 GPU·메모리 상태와 VLLM worker 프로세스 배치를 보여주는 터미널 캡처다.
Screenshot

두 번째 이미지는 첫 번째와 같은 시스템 상태를 다른 미리보기 URL로 제공하며, 16개 GPU의 메모리 점유율과 VLLM worker 목록을 함께 담고 있다. GPU별 메모리 사용량은 약 15 GiB 이상으로 높고, 프로세스 이름에는 PP와 TP 조합이 표시된다. 따라서 게시물의 Pipeline Parallel·Tensor Parallel 구성이 실제 실행 프로세스에 반영된 정황을 보탠다.

16개 RTX 5060 Ti의 GPU·메모리 상태와 VLLM worker 프로세스 배치를 보여주는 터미널 캡처다.

용어 해설

BAR1 메모리 매핑(BAR1)
GPU가 PCIe를 통해 호스트 주소 공간에 자신의 비디오 메모리를 매핑하는 영역이다. 이 구성에서는 16개 GPU 각각에 16,384 MiB BAR1을 배정해 대규모 GPU 간 통신과 메모리 접근을 지원한다.
Resizable BAR
CPU가 GPU 메모리의 작은 창만 순차적으로 접근하지 않고 더 큰 주소 범위를 한 번에 매핑하도록 하는 PCIe 기능이다. 게시물은 NVIDIA 모듈에서 NVreg_EnableResizableBar=1을 활성화했다.
PCIe 접근 제어 서비스(PCIe ACS)
PCIe 장치 간 트래픽의 격리와 라우팅을 제어하는 기능이다. 구성자는 PLX PEX 브리지마다 ACS 제어 레지스터를 수정해 같은 스위치 클러스터 안의 GPU 통신 경로를 조정했다.
Tensor Parallel
하나의 모델 레이어 계산을 여러 GPU에 나눠 각 GPU가 텐서 일부를 처리하게 하는 병렬화 방식이다. 게시물은 8-way와 4-way 구성을 각각 Pipeline Parallel과 조합했다.
Pipeline Parallel
모델의 연속된 레이어 구간을 서로 다른 GPU 그룹에 배치하고 마이크로배치가 단계별로 흐르도록 하는 방식이다. 게시물은 Tensor Parallel 8·Pipeline Parallel 2와 Tensor Parallel 4·Pipeline Parallel 4를 사용했다.
all-reduce 집계 통신(all-reduce)
여러 GPU가 계산한 값을 합산하거나 평균낸 뒤 그 결과를 모든 GPU에 되돌리는 집단 통신 연산이다. 게시물은 각 PLX 클러스터 내부에서 동작하는 사용자 정의 all-reduce를 추가로 구성했다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.