본문으로 건너뛰기

Framework Strix Halo eGPU 연결 실패기

eGPU 연결은 불안정했고 llama-server 분산 추론은 작동했지만 Gen1 PCIe 병목으로 속도 향상은 없었습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Framework Strix Halo에서 eGPU를 사용하려고 ADT-link UT3G와 F9G·OCuLink 조합을 시험했지만, 첫 구성에서는 NVIDIA GPU가 PCIe 버스에서 이탈했고 두 번째 구성에서는 PCIe 연결이 Gen1로 하향됐습니다. llama-server는 내부 AMD GPU와 외장 NVIDIA GPU를 Vulkan 장치로 함께 인식하고 `-ts 6,128` 설정으로 단일 모델을 분산 실행했지만, Gen1 대역폭과 외장 GPU 규모 때문에 속도 이득은 없었습니다. 결과적으로 소프트웨어 설정 자체는 작동했으나 eGPU 연결 안정성과 PCIe 링크 협상이 실용성을 제한했습니다.

실용적 조언

  • eGPU 연결을 시도할 때는 GPU와 호스트 사이의 PCIe 링크 세대가 실제로 무엇으로 협상됐는지 확인해야 하며, 본문 사례에서는 Gen4가 아니라 Gen1로 동작했습니다.
  • llama-server에서 서로 다른 제조사의 내부 GPU와 외장 GPU를 함께 사용하려면 `-dev Vulkan0,Vulkan1`처럼 장치를 명시하고, 단일 모델을 나눌 때는 `-ts` 값을 지정해야 합니다.
  • 외장 GPU가 드라이버에 나타나지 않을 때는 nouveau 블랙리스트 여부만 확인하지 말고 `nvidia-smi`, `modprobe` 오류, 커널 로그의 `fallen off the bus` 메시지를 함께 확인해야 합니다.

섹션별 상세

01
작성자는 Framework Strix Halo에서 eGPU를 구동하려고 ADT-link UT3G를 먼저 사용했지만 Fedora 부팅 뒤 연결이 일관되게 유지되지 않았습니다. `nvidia-smi`에서는 `modprobe: ERROR: could not insert 'nvidia': No such device`가 발생했고, 커널 로그에는 NVIDIA GPU가 버스에서 이탈해 명령에 응답하지 않는다는 `fallen off the bus` 메시지가 기록됐습니다. nouveau 블랙리스트 설정과 부팅 메시지를 확인한 뒤에도 문제가 해결되지 않아, Deepseek의 검색·디버깅 판단은 하드웨어 결함 가능성에 무게를 뒀습니다.
bash
llama-server -m laguna-s-2.1-Q4_K_M.gguf -c 131072 --temp 1.0 --top-p 1.0 --min-p 0.01 --reasoning-preserve --load-mode none -fa on --fit off --jinja --kv-unified -ngl 999 -ts 6,128 --main-gpu 1 -dev Vulkan0,Vulkan1

llama-server에서 외장 NVIDIA GPU와 내부 AMD GPU를 명시하고 하나의 GGUF 모델 가중치를 두 GPU에 분산하는 실행 명령입니다.

02
F9G, OCuLink Cable, M.2 to OCuLink Adapter 조합은 UT3G보다 반응이 나았지만 PCIe Gen4 연결이 성립하지 않고 반복해서 Gen1로 낮아졌습니다. 작성자는 케이블 품질을 원인으로 보지 않았으며, 어댑터가 Gen3 이상을 유지하지 못했을 가능성을 남겼습니다. llama-server에서는 Vulkan0을 외장 3060 Ti, Vulkan1을 내부 GPU로 지정하고 `-ts 6,128`으로 단일 모델을 두 GPU에 분산할 수 있었지만, 작은 외장 GPU와 Gen1 PCIe 병목 때문에 속도 향상은 없었습니다.

용어 해설

외장 GPU(eGPU)
노트북이나 소형 컴퓨터에 외부 연결 방식으로 GPU를 추가하는 구성입니다. 본문에서는 Framework Strix Halo의 내부 AMD GPU와 외장 NVIDIA GPU를 함께 사용하려고 PCIe·OCuLink 연결을 구성했지만, 연결 안정성과 PCIe 세대 협상이 주요 문제가 됐습니다.
PCIe 링크 협상(PCIe Link Training)
PCIe 장치와 호스트가 지원 가능한 속도와 세대를 협의해 연결을 설정하는 과정입니다. 본문에서는 Gen4 연결이 성립하지 않고 Gen1로 반복 하향되면서 외장 GPU의 대역폭이 제한됐습니다.
nouveau
Linux에서 NVIDIA GPU를 지원하는 오픈소스 그래픽 드라이버입니다. 본문에서는 nouveau를 블랙리스트에 등록했는데도 부팅 중 관련 문구가 나타났으며, 실제 원인은 nouveau가 아니라 NVIDIA 장치가 PCIe 버스에서 이탈한 상태로 추정됐습니다.
NVIDIA GPU 상태 확인 도구(nvidia-smi)
NVIDIA 드라이버와 GPU의 상태를 확인하는 명령줄 도구입니다. 본문에서는 `nvidia-smi`가 NVIDIA 드라이버와 통신하지 못했고, `modprobe`의 장치 없음 오류와 함께 외장 GPU 연결 실패를 확인하는 데 사용됐습니다.
Tensor 분할(tensor-split)
하나의 모델 가중치나 계산을 여러 GPU에 나눠 배치하는 설정입니다. 본문에서는 Vulkan0과 Vulkan1을 명시하고 `-ts 6,128`을 지정해 NVIDIA 외장 GPU와 AMD 내부 GPU 사이에 모델을 분산하려 했습니다.

언급된 도구

llama-server중립

내부 AMD GPU와 외장 NVIDIA GPU를 Vulkan 장치로 지정하고 하나의 GGUF 모델을 여러 GPU에 분산해 추론하는 데 사용했습니다.

Deepseek중립

eGPU 연결 실패 원인을 웹 검색과 디버깅 결과를 바탕으로 하드웨어 문제로 판단하는 데 참고했습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.