본문으로 건너뛰기

AMD llama.cpp 브랜치의 Strix Halo 성능

ROCm/Hip 기반 AMD llama.cpp 브랜치가 Strix Halo의 14B Dense 모델 Prompt Processing을 약 550 tokens/s로 끌어올렸다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AMD-Ecosystem의 llama.cpp 브랜치는 Deprecation 경고가 있어도 유지보수되고 있으며, 변경 사항이 일반 llama.cpp에 나중에 반영됩니다. Strix Halo에서 ROCm/Hip을 사용하면 14B Dense 모델의 Prompt Processing 속도가 약 230 tokens/s에서 약 550 tokens/s로 높아졌습니다. 반면 TG 속도는 Vulkan보다 약 15% 낮았고 MoE 속도는 같아, 개선 효과가 backend와 모델 구조에 따라 달라졌습니다.

실용적 조언

  • Strix Halo에서 llama.cpp를 사용할 때 Prompt Processing 성능이 중요하면 AMD-Ecosystem 브랜치와 ROCm/Hip backend를 비교할 수 있습니다. 14B Dense 모델 기준 게시물 측정값은 일반 llama.cpp의 약 230 tokens/s 대비 약 550 tokens/s였습니다. 다만 TG 속도는 Vulkan보다 약 15% 낮았으므로 프롬프트 처리와 생성 속도를 별도로 측정해야 합니다.

섹션별 상세

01
작성자는 AMD-Ecosystem의 llama.cpp 브랜치가 Deprecation 경고와 달리 계속 유지보수되고 있으며, 변경 사항이 이후 일반 llama.cpp에 반영된다고 설명했습니다. Strix Halo에서 ROCm/Hip을 사용할 때 적용되는 새 패치가 있어 프롬프트 처리 경로의 성능을 비교했습니다. 이는 특정 하드웨어와 backend 조합에서 llama.cpp 구현 차이가 추론 성능에 영향을 줄 수 있다는 사례입니다.
02
14B Dense 모델의 Prompt Processing 속도는 일반 llama.cpp의 약 230 tokens/s에서 AMD 브랜치 사용 시 약 550 tokens/s로 높아져 2배를 넘었습니다. 반면 TG 속도는 Vulkan 사용 때보다 약 15% 느렸고, MoE 모델의 속도는 동일했습니다. 따라서 개선 효과는 모든 추론 단계와 모델 구조에 일괄 적용되지 않고, ROCm/Hip 기반 Prompt Processing과 Dense 모델 조합에 집중됐습니다.

용어 해설

프롬프트 처리(Prompt Processing)
입력 프롬프트의 토큰을 모델에 한꺼번에 넣어 다음 단계의 추론을 준비하는 처리 구간이다. 생성 토큰을 하나씩 만드는 단계와 달리 입력 길이에 따른 계산량과 병렬화 효율의 영향을 크게 받으며, 이 글에서는 dense 모델의 처리 속도 비교에 사용됐다.
Dense 모델(Dense Model)
각 토큰을 처리할 때 모델의 전체 파라미터가 계산에 참여하는 구조다. 일부 Expert만 선택하는 MoE 모델과 계산 경로가 다르기 때문에 같은 추론 엔진과 하드웨어에서도 프롬프트 처리 및 토큰 생성 속도가 달라질 수 있으며, 글에서는 14B 모델 측정에 적용됐다.
Mixture-of-Experts(MoE)
여러 Expert 중 일부만 선택해 토큰을 처리하는 모델 구조다. 전체 파라미터 규모와 실제 연산량이 다를 수 있어 Dense 모델과 성능 양상이 달라지며, 이 글에서는 ROCm/Hip 패치 적용 뒤 속도 변화가 Dense 모델과 달랐다는 비교 대상으로 쓰였다.

언급된 도구

llama.cpp중립링크

C/C++ 환경에서 LLM 추론을 실행하며, AMD-Ecosystem 브랜치와 일반 브랜치의 성능 비교에 사용됐습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 23.수집 2026. 08. 23.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.