본문으로 건너뛰기

AMD V620에서 Qwen과 Gemma의 llama cpp 벤치마크

AMD V620에서 ROCm과 Vulkan으로 Qwen·Gemma의 긴 문맥 처리 속도를 비교했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 Windows 11의 AMD V620에서 llama cpp를 Vulkan과 ROCm으로 실행하며 Qwen과 Gemma GGUF 모델의 긴 문맥 벤치마크를 비교했습니다. 약 3.4k~26.7k 토큰 문맥과 max_tokens=16, temperature=0 조건에서 측정한 결과, ROCm은 두 모델의 생성 속도와 짧은 문맥의 프롬프트 처리에서 대체로 앞섰지만 Gemma Vulkan의 긴 문맥 PP는 일부 구간에서 더 높았습니다. Qwen과 Gemma에 서로 다른 MTP draft, KV cache 양자화, 배치 크기 설정을 적용했으며, 작성자는 flags와 설정을 계속 조정하고 있습니다.

섹션별 상세

01
작성자는 Windows 11의 AMD V620에서 llama.cpp를 Vulkan과 ROCm으로 실행한 뒤 Qwen과 Gemma의 처리 속도를 비교했습니다. 약 13페이지 분량의 실제 책 발췌문을 문맥으로 넣고 max_tokens=16, temperature=0을 고정해 측정했으며, 설정값을 함께 공개해 비교 조건을 확인할 수 있게 했습니다. 결과는 단순 사용 후기보다 backend, KV cache 양자화, MTP draft 설정이 함께 얽힌 재현 가능한 벤치마크에 가깝습니다.
02
Qwen에서는 ROCm이 약 3.4k 토큰 문맥에서 PP 364, gen 14.3 t/s를 기록해 Vulkan의 PP 235, gen 8.6 t/s보다 높았습니다. 문맥이 약 6.6k에서 26.7k 토큰으로 늘어나자 Qwen 생성 속도는 ROCm 21.0에서 18.3 t/s, Vulkan 21.5에서 17.9 t/s로 비슷한 범위에 머물렀고, PP는 각각 358에서 295, 233에서 131로 낮아졌습니다. 따라서 Qwen 측정에서는 ROCm의 프롬프트 처리 우위가 두드러졌지만 긴 문맥의 생성 속도 차이는 작았습니다.
03
Gemma에서는 짧은 약 3.4k 토큰 문맥에서 ROCm이 PP 1020, gen 50.5 t/s를 기록해 Vulkan의 PP 431, gen 5.2 t/s를 크게 앞섰습니다. 약 6.6k 토큰에서는 ROCm 814 / 76.8 t/s, Vulkan 721 / 65.1 t/s로 차이가 줄었고, 약 13.3k와 26.6k 토큰에서는 Vulkan의 PP가 각각 538과 353으로 ROCm의 514와 284보다 높았지만 gen은 ROCm이 65.8과 54.8 t/s로 Vulkan의 59.9와 51.1 t/s보다 높았습니다. backend별 결과가 문맥 길이와 설정 조합에 따라 달라져 단일 수치만으로 우열을 고정하기 어려운 형태입니다.
04
작성자는 벤치마크 수치가 AI로 작성된 형식이지만 직접 검증해 정확하다고 밝혔고, 현재도 flags와 설정을 조정하고 있습니다. Qwen ROCm과 Vulkan에는 grafted MTP를 사용했고 Gemma에는 별도 MTP draft 파일과 `--spec-draft-device ROCm0`를 적용해 모델별 추측 디코딩 조건도 달랐습니다. 그러므로 표의 차이는 ROCm과 Vulkan의 backend 차이만이 아니라 MTP, `-ctk`·`-ctv`, 배치 크기, `--cache-reuse` 설정이 함께 반영된 결과입니다.

용어 해설

추측 디코딩(Speculative Decoding)
작은 draft 모델이 다음 토큰 후보를 먼저 생성하고, 대상 모델이 이를 한꺼번에 검증해 생성 단계를 줄이는 추론 방식입니다. 이 글에서는 MTP draft 설정과 함께 사용되며, 생성 속도 비교에 영향을 주는 핵심 요소입니다.
GGUF 모델 파일 형식(GGUF)
llama.cpp 계열 추론 환경에서 모델 가중치와 관련 메타데이터를 저장하는 파일 형식입니다. 글의 Qwen과 Gemma 모델이 모두 GGUF 파일로 지정됐으며, Q5_K_P와 Q4_K_P 같은 양자화 방식이 파일명에 포함돼 있습니다.
프롬프트 처리(Prompt Processing)
입력 문맥의 토큰을 모델에 전달해 내부 상태를 계산하는 단계입니다. 표의 PP 수치는 약 3.4k부터 26.7k 토큰까지 이어지는 13페이지 분량의 문맥을 처리한 속도를 나타냅니다.
토큰 생성(Token Generation)
문맥 처리가 끝난 뒤 모델이 새 토큰을 순차적으로 출력하는 단계입니다. 표의 gen 수치는 초당 생성 토큰 수이며, 모든 실험에서 max_tokens=16과 temperature=0 조건이 적용됐습니다.

코드 예제

bash
Qwen ROCm:  — `Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q5_K_P.gguf`, grafted MTP (no `-md`), `--spec-type draft-mtp --spec-draft-n-max 3`, `-ctk q4_0 -ctv q4_0`, `-ngl 99 -np 1 -b/-ub 1024 -t 12`.

Qwen GGUF 모델을 ROCm에서 실행하면서 grafted MTP와 q4_0 KV cache 설정을 적용한 구성입니다.

bash
Qwen Vulkan:  — same model, now also grafted MTP (just fixed), `-ctk q8_0 -ctv q4_0`, `-ngl 99 -np 1 -b/-ub 1024 -t 12`.

같은 Qwen 모델을 Vulkan에서 실행하되 Q/K와 V 캐시 양자화 설정을 ROCm 구성과 다르게 둔 사례입니다.

bash
Gemma ROCm:  — `Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-Q4_K_P.gguf` + `-md gemma-4-26B-A4B-it-qat-assistant-MTP-Q8_0.gguf`, `--spec-draft-n-max 2 --spec-draft-device ROCm0`, `-ctk q8_0 -ctv q8_0`, `-ngl 99 -ngld 99 -b/-ub 1024`.

Gemma 대상 모델과 별도 MTP draft 모델을 ROCm0에서 함께 사용한 실행 구성입니다.

bash
Gemma Vulkan: — same Gemma model+draft, `-ctk q4_0 -ctv q5_1`, `-ngl 99 -ngld 99 -b/-ub 512 --cache-reuse 256`.

Gemma 모델과 draft 모델을 Vulkan에서 실행하면서 배치 크기와 cache reuse 설정을 ROCm 구성과 다르게 둔 사례입니다.

언급된 도구

llama cpp중립

AMD V620에서 GGUF 언어 모델을 Vulkan과 ROCm backend로 실행하고 PP와 gen 속도를 측정하는 추론 도구입니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.