TL;DR
llama.cpp의 PR은 AVX2 경로를 활용해 큰 배치에서 IQ 양자화 모델의 CPU 처리 속도를 높였습니다. EPYC 9654 24스레드와 batch size 512 조건에서 Qwen3.6-27B의 IQ3_S 처리량은 4.75 tok/s에서 65.45 tok/s로 1277.9% 증가했고, PPL 변화는 +0.04%였습니다. Qwen3.6-35B-A3B에서도 IQ1_S가 123.3%, IQ3_S가 175.8% 상승했으며, 작성자는 낮은 배치에서는 증가 폭이 줄고 실행별 수치가 약간 달라질 수 있다고 밝혔습니다.
실용적 조언
- 큰 배치의 CPU 평가 성능을 비교할 때는 특정 양자화 형식 하나가 아니라 IQ1_S, IQ1_M, IQ2 계열, IQ3 계열, IQ4_XS처럼 각 텐서 형식을 따로 측정해야 합니다. 이 글처럼 pure 모델을 사용하면 일부 텐서 형식이 실행 경로에서 빠지는 문제를 줄일 수 있습니다. 다만 실행 시간이 길수록 반복 측정으로 변동 폭을 확인해야 합니다.
섹션별 상세
용어 해설
- IQ 양자화(IQ quantization)
- — IQ 양자화는 모델 가중치를 낮은 비트 형식으로 압축해 메모리 사용량을 줄이는 방식입니다. 이 글에서는 IQ1부터 IQ4까지 여러 형식을 CPU의 대규모 배치 처리에 적용하고 속도와 PPL 변화를 비교합니다.
- Perplexity
- — Perplexity는 언어 모델이 평가 데이터의 다음 토큰을 얼마나 잘 예측하는지 나타내는 지표입니다. 수치가 낮을수록 예측 오차가 작다는 뜻이며, 이 글에서는 PR 적용 전후의 양자화 품질 변화를 PPL로 비교합니다.
- 배치 크기(batch size)
- — 배치 크기는 한 번의 처리 단계에서 함께 계산하는 입력 묶음의 크기입니다. 이 벤치마크는 batch size 512의 큰 배치에서 IQ 양자화 모델의 CPU 처리 속도를 측정했으며, 작은 배치에서는 증가 폭이 더 작다고 밝혔습니다.
- imatrix
- — imatrix는 양자화 과정에서 모델의 중요도 정보를 활용하는 처리 맥락을 가리킵니다. 글의 문제 설정은 imatrix와 perplexity처럼 큰 배치가 필요한 CPU 작업에서 IQ quant의 속도가 특히 낮다는 점이며, 이를 PR의 성능 개선 대상으로 삼습니다.
언급된 도구
IQ 양자화 모델의 CPU 대규모 배치 처리와 perplexity 성능을 비교하는 코드베이스입니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.