TL;DR
AMD-Ecosystem의 llama.cpp 브랜치는 Deprecation 경고가 있어도 유지보수되고 있으며, 변경 사항이 일반 llama.cpp에 나중에 반영됩니다. Strix Halo에서 ROCm/Hip을 사용하면 14B Dense 모델의 Prompt Processing 속도가 약 230 tokens/s에서 약 550 tokens/s로 높아졌습니다. 반면 TG 속도는 Vulkan보다 약 15% 낮았고 MoE 속도는 같아, 개선 효과가 backend와 모델 구조에 따라 달라졌습니다.
실용적 조언
- Strix Halo에서 llama.cpp를 사용할 때 Prompt Processing 성능이 중요하면 AMD-Ecosystem 브랜치와 ROCm/Hip backend를 비교할 수 있습니다. 14B Dense 모델 기준 게시물 측정값은 일반 llama.cpp의 약 230 tokens/s 대비 약 550 tokens/s였습니다. 다만 TG 속도는 Vulkan보다 약 15% 낮았으므로 프롬프트 처리와 생성 속도를 별도로 측정해야 합니다.
섹션별 상세
용어 해설
- 프롬프트 처리(Prompt Processing)
- — 입력 프롬프트의 토큰을 모델에 한꺼번에 넣어 다음 단계의 추론을 준비하는 처리 구간이다. 생성 토큰을 하나씩 만드는 단계와 달리 입력 길이에 따른 계산량과 병렬화 효율의 영향을 크게 받으며, 이 글에서는 dense 모델의 처리 속도 비교에 사용됐다.
- Dense 모델(Dense Model)
- — 각 토큰을 처리할 때 모델의 전체 파라미터가 계산에 참여하는 구조다. 일부 Expert만 선택하는 MoE 모델과 계산 경로가 다르기 때문에 같은 추론 엔진과 하드웨어에서도 프롬프트 처리 및 토큰 생성 속도가 달라질 수 있으며, 글에서는 14B 모델 측정에 적용됐다.
- Mixture-of-Experts(MoE)
- — 여러 Expert 중 일부만 선택해 토큰을 처리하는 모델 구조다. 전체 파라미터 규모와 실제 연산량이 다를 수 있어 Dense 모델과 성능 양상이 달라지며, 이 글에서는 ROCm/Hip 패치 적용 뒤 속도 변화가 Dense 모델과 달랐다는 비교 대상으로 쓰였다.
언급된 도구
C/C++ 환경에서 LLM 추론을 실행하며, AMD-Ecosystem 브랜치와 일반 브랜치의 성능 비교에 사용됐습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.