본문으로 건너뛰기
r/LocalLLaMA조회 1

인텔 Arc BMG G31 (Battlemage) llama.cpp 초기 벤치마크 결과

인텔의 차세대 GPU Battlemage BMG G31에서 llama.cpp를 구동하여 SYCL 백엔드가 Vulkan보다 우수한 추론 성능을 보임을 확인했다.

실용적 조언

  • 인텔 GPU에서 llama.cpp를 사용한다면 Vulkan보다는 SYCL 백엔드를 우선적으로 고려해야 성능 이득을 볼 수 있다.
  • Battlemage 하드웨어를 테스트하려면 리눅스 커널 6.19.8 이상의 최신 환경과 Xe 펌웨어 업데이트가 필요하다.

섹션별 상세

01
SYCL 백엔드에서 Qwen 3.5 27B Q4_K 모델을 구동했을 때 프롬프트 처리(pp512) 속도는 798.07 t/s, 토큰 생성(tg128) 속도는 15.64 t/s를 기록했다. 인텔의 oneAPI 런타임을 활용한 이 방식은 현재 Battlemage 하드웨어에서 가장 높은 효율을 보여주는 추론 경로이다. 수치상으로 대형 모델임에도 불구하고 실사용 가능한 수준의 생성 속도를 확보했다.
bash
build/bin/llama-bench -hf unsloth/Qwen3.5-27B-GGUF:UD-Q4_K_XL -p 512,16384 -n 128,512

SYCL 백엔드를 사용하여 Qwen 3.5 27B 모델의 성능을 측정하는 벤치마크 명령어

02
Vulkan 백엔드 테스트 결과 프롬프트 처리 속도는 504.19 t/s로 SYCL 대비 약 37% 낮은 성능을 보였으며 토큰 생성 속도 역시 14.10 t/s로 측정됐다. 최신 Mesa 드라이버를 소스에서 빌드하여 적용했음에도 불구하고 전용 런타임인 SYCL에 비해 최적화가 부족한 상태임이 확인됐다. 이는 범용 API인 Vulkan이 하드웨어 특화 기능을 완전히 활용하지 못하고 있음을 시사한다.
text
ggml_vulkan: Found 1 Vulkan devices: ggml_vulkan: 0 = Intel(R) Graphics (BMG G31) (Intel open-source Mesa driver)
| uma: 0 | fp16: 1 | bf16: 0 | warp size: 32 | shared memory: 49152 | int dot: 1 | matrix cores: NV_coopmat2

Vulkan 백엔드에서 인식된 Intel Arc BMG G31(Battlemage) 하드웨어 정보

03
OpenVINO 2026.0 버전을 통한 GPU 가속 시도는 텐서 할당 및 메모리 버퍼 복사 오류(CPY 연산 불가)로 인해 프로그램이 중단되는 결과를 낳았다. 작성자는 이전에 작동했던 경험이 있다고 언급했으나 현재 드라이버와 런타임의 조합에서는 안정성 문제가 발생했다. 이는 차세대 하드웨어 지원을 위한 소프트웨어 스택이 아직 초기 단계에 머물러 있음을 보여준다.
text
GGML_OPENVINO_DEVICE=GPU GGML_OPENVINO_STATEFUL_EXECUTION=1 build_ov/bin/llama-bench -hf unsloth/Qwen3.5-27B-GGUF:UD-Q4_K_XL -p OpenVINO: using device GPU
// ...(중략)
Aborted

OpenVINO 백엔드 실행 시 발생한 텐서 할당 오류 및 중단 로그

04
테스트 환경 구축을 위해 커널 6.19.8, Debian 13, 최신 Xe 펌웨어 및 Mesa 드라이버를 직접 빌드하여 적용하는 과정이 수반됐다. 하드웨어가 공식 출시 전이거나 초기 단계인 만큼 표준 배포판의 드라이버로는 정상 작동이 어려우며 최신 개발용 런타임이 필수적이다. 작성자는 현재의 상태를 '겨우 작동하기 직전의 경계'라고 표현하며 소프트웨어 생태계의 성숙이 필요함을 언급했다.

용어 해설

SYCL
C++ 기반의 이기종 컴퓨팅 추상화 계층으로, 인텔 GPU에서 고성능 연산을 수행하기 위해 oneAPI 런타임과 함께 사용되는 핵심 기술이다. 단일 소스 코드로 다양한 하드웨어 가속기를 지원하며, llama.cpp에서 인텔 그래픽 카드의 성능을 극대화하는 데 필수적이다.
벌컨(Vulkan)
크로스 플랫폼 그래픽 및 계산 API로, 특정 제조사에 종속되지 않고 GPU의 하드웨어 자원에 직접 접근하여 오버헤드를 줄인 가속을 제공한다. AI 추론 시 다양한 GPU 환경에서 범용적인 가속 수단으로 활용되지만, 전용 런타임 대비 최적화 수준이 다를 수 있다.
오픈비노(OpenVINO)
인텔에서 개발한 딥러닝 추론 최적화 및 배포 툴킷으로, 인텔 CPU와 GPU 아키텍처에 맞춰 모델 실행 효율을 극대화하도록 설계됐다. 하드웨어 특성에 맞춘 그래프 최적화와 양자화 기술을 통해 추론 속도를 향상시키고 지연 시간을 단축한다.
GGUF
llama.cpp 프로젝트에서 도입한 바이너리 파일 형식으로, 대규모 언어 모델의 가중치와 메타데이터를 하나의 파일에 저장하고 효율적으로 로드할 수 있게 한다. 특히 양자화된 모델을 CPU와 GPU 간에 유연하게 오프로딩하여 메모리 사용량을 최적화하는 데 강점이 있다.

언급된 도구

llama.cpp추천

LLM 추론 엔진

OpenVINO중립

인텔 하드웨어 최적화 추론 툴킷

Mesa추천

오픈소스 그래픽 드라이버 스택

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 04.수집 2026. 04. 04.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.