TL;DR
ThinkPad P14s Gen 6 AMD의 Radeon 890M에서 Qwen3.6-35B-A3B Q8_0을 구동한 측정 결과, 프리필은 약 450 t/s지만 65k 토큰부터 콜드 시작 대기가 실사용 한계가 됐다. 작성자는 qwen-code의 세션 워밍업과 llama.cpp의 디스크 프롬프트 캐시로 41.6k 토큰 시작 프롬프트의 첫 요청을 100초에서 9초로 줄였고, SLOT_RESTORE 버그 수정으로 캐시 복구 후 처리 시간을 10.01초에서 0.17초로 낮췄다. IOMMU를 끄면 프리필 26%, 생성 16%가 빨라졌으며, DPM·VRAM carve-out·CPU governor 같은 설정은 대부분 이득이 없거나 조건에 따라 성능을 악화시켰다. 따라서 이 구성은 노트북 iGPU에서 쓸 수 있지만 전체 코딩 작업을 대체하기보다 캐시 재사용이 가능한 제한된 작업에 적합하다.
실용적 조언
- 긴 시작 프롬프트를 사용하는 coding client에서는 세션 시작 시 max_tokens=1 워밍업 요청을 보내고, llama.cpp 서버를 -np 1로 실행해 워밍업 요청과 실제 요청이 같은 슬롯의 KV cache를 공유하게 해야 한다.
- 로그인 때마다 서버를 재시작한다면 --cache-disk-path로 프롬프트 캐시를 디스크에 보존하고, 복구 뒤 prompt.checkpoints가 실제로 채워지는지 확인해야 한다.
- GPU 성능 비교 때는 /proc/cmdline을 측정 결과에 함께 기록해 amd_iommu 설정을 고정해야 하며, 전력 소비가 낮다는 이유만으로 스로틀링을 단정하지 않아야 한다.
- UMA/VRAM carve-out, CPU governor, TSME, GPU DPM을 바꿀 때는 프리필과 생성을 분리해 측정해야 한다. 특히 DPM high는 프리필과 생성에 반대 방향의 영향을 줄 수 있고, GPU 클록과 전력이 비정상적으로 낮으면 하드웨어 상태부터 확인해야 한다.
- speculative decoding은 draft 방식별 거부율을 확인해야 한다. 글의 측정에서는 draft-mtp가 생성 속도를 13% 높였지만 ngram 계열은 초안 87~92%가 거부되어 손해가 발생했다.
섹션별 상세
용어 해설
- 프리필(Prefill)
- — 프리필은 사용자가 입력한 프롬프트 전체를 모델이 처음 처리해 첫 출력 토큰을 준비하는 단계이다. 입력 토큰을 순차적으로 계산해 KV cache를 만들며, 긴 코딩 클라이언트 시작 프롬프트에서는 생성 속도보다 첫 응답까지의 대기 시간을 크게 좌우한다.
- KV 캐시(KV Cache)
- — KV Cache는 Attention 계산에 사용한 Key와 Value를 저장해 이미 처리한 프롬프트를 다시 계산하지 않도록 하는 메모리 구조이다. 캐시가 재사용되면 긴 시작 프롬프트의 전체 프리필을 건너뛰고 새로 입력된 부분만 처리할 수 있다.
- Graphics Translation Table(GTT)
- — GTT는 GPU가 시스템 RAM에 배치된 데이터를 GPU 주소 공간에서 접근하도록 연결하는 구조이다. 이 사례처럼 모델이 약 36GB의 시스템 RAM에 상주하면 GPU 접근마다 주소 변환 비용이 발생할 수 있어 IOMMU 설정에 따라 프리필과 생성 속도가 달라진다.
- IOMMU
- — IOMMU는 장치가 메모리에 접근할 때 주소 변환과 접근 격리를 수행하는 하드웨어 기능이다. 글의 환경에서는 GTT에 저장된 모델 데이터에 대한 GPU 접근이 주소 변환으로 지연되어 IOMMU를 끄자 프리필이 26%, 생성이 16% 빨라졌다.
- 추측 디코딩(Speculative Decoding)
- — 추측 디코딩은 작은 초안 생성기가 다음 토큰을 먼저 예측하고, 큰 모델이 해당 토큰을 한 번에 검증하는 방식이다. 글에서는 draft-mtp가 생성 속도를 13% 높였지만 ngram 방식은 초안의 87~92%가 거부되어 추측을 사용하지 않을 때보다 느렸다.
언급된 도구
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.