본문으로 건너뛰기

Radeon 8060s에서 Qwen 3.5 27B 실행 시 Vulkan OOM 및 ROCm 성능 이슈

Radeon 8060s 환경에서 Qwen 3.5 27B 모델 구동 시 Vulkan 백엔드의 메모리 부족 오류와 ROCm의 낮은 추론 성능 문제를 분석한다.

커뮤니티 반응

사용자들은 AMD 하드웨어에서 Vulkan과 ROCm의 드라이버 안정성 차이에 주목하며, 특히 통합 메모리 환경에서의 메모리 오버헤드 문제를 지적하고 있습니다.

실용적 조언

  • Vulkan OOM 문제를 해결하기 위해 컨텍스트 크기를 2048~4096 수준으로 대폭 낮추어 테스트할 것
  • --no-mmap 옵션을 제거하여 OS의 가상 메모리 관리 기능을 활용해 볼 것
  • 최신 AMD HIP SDK 및 드라이버 업데이트를 통해 ROCm 백엔드의 성능 최적화를 시도할 것

섹션별 상세

Vulkan 백엔드와 ROCm 백엔드 간의 성능 역전 현상이 보고됐다. 9B 모델에서는 Vulkan이 22 t/s로 ROCm의 18 t/s보다 빨랐으나, 27B 모델에서는 Vulkan이 모델 로드 마지막 단계에서 메모리 부족으로 크래시가 발생하는 반면 ROCm은 정상적으로 로드됐다.
bash
./llama-server.exe ` -hf unsloth/Qwen3.5-27B-GGUF ` --hf-file Qwen3.5-27B-UD-Q4_K_XL.gguf ` --alias "Qwen3.5-27B" ` -ngl 99 ` -fa on ` --jinja ` --reasoning-format deepseek ` -c 60000 ` -n 32768 ` -ctk q8_0 ` -ctv q8_0 ` -t 6 ` --temp 0.6 ` --top-k 20 ` --top-p 0.95 ` --min-p 0.0 ` --presence-penalty 0.0 ` --repeat-penalty 1.0 ` --mlock ` --no-mmap ` --parallel 1 ` --host 0.0.0.0 ` --port 8001 ` --verbose

사용자가 Qwen 3.5 27B 모델을 실행하기 위해 사용한 llama.cpp 서버 실행 명령

llama.cpp 설정 중 컨텍스트 크기(-c 60000)와 KV 캐시 양자화(-ctk q8_0, -ctv q8_0)가 메모리 점유에 큰 영향을 미치고 있다. 사용자는 컨텍스트를 8192로 줄이고 플래그를 제거해도 Vulkan에서의 OOM 문제가 해결되지 않는다고 밝혔다.
Vulkan 백엔드 사용 시 KV 캐시 버퍼 크기가 0.00 MiB로 표시되는 이상 현상이 관찰됐다. 이는 ROCm에서 1997.50 MiB로 정상 표시되는 것과 대조적이며, 최신 llama.cpp 빌드의 버그일 가능성이 제기됐다.
text
llama_model_load: error loading model: vk::Device::waitForFences: ErrorOutOfDeviceMemory
llama_model_load_from_file_impl: failed to load model

Vulkan 백엔드 사용 시 발생하는 메모리 부족(OOM) 에러 로그

통합 메모리 시스템(Unified Memory)에서의 VRAM 할당 한계 문제가 논의됐다. 32GB RAM 중 24GB를 VRAM으로 할당했음에도 불구하고, Vulkan 드라이버가 실제 가용 메모리를 관리하는 방식에서 충돌이 발생하여 'ErrorOutOfDeviceMemory'를 출력했다.

용어 해설

벌칸(Vulkan)
고성능 그래픽 및 컴퓨팅을 위한 크로스 플랫폼 API이다. 하드웨어에 직접적으로 접근하여 오버헤드를 줄이며, AMD GPU 환경에서 ROCm의 대안으로 널리 사용된다.
ROCm
AMD에서 개발한 오픈소스 소프트웨어 플랫폼으로, GPU 가속 컴퓨팅을 지원한다. NVIDIA의 CUDA와 유사한 역할을 수행하며 리눅스와 윈도우 환경에서 AMD GPU의 성능을 극대화한다.
KV 캐시(KV Cache)
LLM 추론 시 이전 토큰들의 Key와 Value 행렬을 저장하여 재계산을 방지하는 기술이다. 컨텍스트 길이가 길어질수록 메모리 점유율이 급격히 증가하는 특징이 있다.
통합 메모리(Unified Memory)
CPU와 GPU가 동일한 물리적 RAM 공간을 공유하는 아키텍처이다. 별도의 전용 VRAM이 없는 내장 그래픽이나 애플 실리콘 등에서 주로 사용되며, 할당량 설정이 성능에 큰 영향을 미친다.
메모리 부족(OOM (Out Of Memory))
시스템이 요청된 작업을 수행하기 위해 필요한 메모리를 할당하지 못했을 때 발생하는 오류이다. LLM 구동 시 모델 가중치나 KV 캐시가 가용 VRAM을 초과할 때 빈번하게 발생한다.

언급된 도구

llama.cpp추천

LLM 추론 엔진 및 서버 실행

unsloth/Qwen3.5-27B-GGUF중립

양자화된 Qwen 3.5 모델 파일 제공처

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 16.수집 2026. 03. 16.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.