TL;DR
작성자는 Windows 11의 AMD V620에서 llama cpp를 Vulkan과 ROCm으로 실행하며 Qwen과 Gemma GGUF 모델의 긴 문맥 벤치마크를 비교했습니다. 약 3.4k~26.7k 토큰 문맥과 max_tokens=16, temperature=0 조건에서 측정한 결과, ROCm은 두 모델의 생성 속도와 짧은 문맥의 프롬프트 처리에서 대체로 앞섰지만 Gemma Vulkan의 긴 문맥 PP는 일부 구간에서 더 높았습니다. Qwen과 Gemma에 서로 다른 MTP draft, KV cache 양자화, 배치 크기 설정을 적용했으며, 작성자는 flags와 설정을 계속 조정하고 있습니다.
섹션별 상세
용어 해설
- 추측 디코딩(Speculative Decoding)
- — 작은 draft 모델이 다음 토큰 후보를 먼저 생성하고, 대상 모델이 이를 한꺼번에 검증해 생성 단계를 줄이는 추론 방식입니다. 이 글에서는 MTP draft 설정과 함께 사용되며, 생성 속도 비교에 영향을 주는 핵심 요소입니다.
- GGUF 모델 파일 형식(GGUF)
- — llama.cpp 계열 추론 환경에서 모델 가중치와 관련 메타데이터를 저장하는 파일 형식입니다. 글의 Qwen과 Gemma 모델이 모두 GGUF 파일로 지정됐으며, Q5_K_P와 Q4_K_P 같은 양자화 방식이 파일명에 포함돼 있습니다.
- 프롬프트 처리(Prompt Processing)
- — 입력 문맥의 토큰을 모델에 전달해 내부 상태를 계산하는 단계입니다. 표의 PP 수치는 약 3.4k부터 26.7k 토큰까지 이어지는 13페이지 분량의 문맥을 처리한 속도를 나타냅니다.
- 토큰 생성(Token Generation)
- — 문맥 처리가 끝난 뒤 모델이 새 토큰을 순차적으로 출력하는 단계입니다. 표의 gen 수치는 초당 생성 토큰 수이며, 모든 실험에서 max_tokens=16과 temperature=0 조건이 적용됐습니다.
코드 예제
Qwen ROCm: — `Qwen3.8-27B-Uncensored-HauhauCS-Aggressive-Q5_K_P.gguf`, grafted MTP (no `-md`), `--spec-type draft-mtp --spec-draft-n-max 3`, `-ctk q4_0 -ctv q4_0`, `-ngl 99 -np 1 -b/-ub 1024 -t 12`.Qwen GGUF 모델을 ROCm에서 실행하면서 grafted MTP와 q4_0 KV cache 설정을 적용한 구성입니다.
Qwen Vulkan: — same model, now also grafted MTP (just fixed), `-ctk q8_0 -ctv q4_0`, `-ngl 99 -np 1 -b/-ub 1024 -t 12`.같은 Qwen 모델을 Vulkan에서 실행하되 Q/K와 V 캐시 양자화 설정을 ROCm 구성과 다르게 둔 사례입니다.
Gemma ROCm: — `Gemma4-26B-A4B-Uncensored-HauhauCS-Balanced-Q4_K_P.gguf` + `-md gemma-4-26B-A4B-it-qat-assistant-MTP-Q8_0.gguf`, `--spec-draft-n-max 2 --spec-draft-device ROCm0`, `-ctk q8_0 -ctv q8_0`, `-ngl 99 -ngld 99 -b/-ub 1024`.Gemma 대상 모델과 별도 MTP draft 모델을 ROCm0에서 함께 사용한 실행 구성입니다.
Gemma Vulkan: — same Gemma model+draft, `-ctk q4_0 -ctv q5_1`, `-ngl 99 -ngld 99 -b/-ub 512 --cache-reuse 256`.Gemma 모델과 draft 모델을 Vulkan에서 실행하면서 배치 크기와 cache reuse 설정을 ROCm 구성과 다르게 둔 사례입니다.
언급된 도구
AMD V620에서 GGUF 언어 모델을 Vulkan과 ROCm backend로 실행하고 PP와 gen 속도를 측정하는 추론 도구입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.