본문으로 건너뛰기

AVX2로 IQ 모델 대규모 배치 CPU 처리 가속

llama.cpp PR이 큰 배치의 IQ 양자화 CPU 처리량을 최대 1277.9% 높이면서 PPL을 거의 유지했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

llama.cpp의 PR은 AVX2 경로를 활용해 큰 배치에서 IQ 양자화 모델의 CPU 처리 속도를 높였습니다. EPYC 9654 24스레드와 batch size 512 조건에서 Qwen3.6-27B의 IQ3_S 처리량은 4.75 tok/s에서 65.45 tok/s로 1277.9% 증가했고, PPL 변화는 +0.04%였습니다. Qwen3.6-35B-A3B에서도 IQ1_S가 123.3%, IQ3_S가 175.8% 상승했으며, 작성자는 낮은 배치에서는 증가 폭이 줄고 실행별 수치가 약간 달라질 수 있다고 밝혔습니다.

실용적 조언

  • 큰 배치의 CPU 평가 성능을 비교할 때는 특정 양자화 형식 하나가 아니라 IQ1_S, IQ1_M, IQ2 계열, IQ3 계열, IQ4_XS처럼 각 텐서 형식을 따로 측정해야 합니다. 이 글처럼 pure 모델을 사용하면 일부 텐서 형식이 실행 경로에서 빠지는 문제를 줄일 수 있습니다. 다만 실행 시간이 길수록 반복 측정으로 변동 폭을 확인해야 합니다.

섹션별 상세

01
이 PR은 imatrix와 perplexity처럼 큰 배치 크기를 사용하는 CPU 작업에서 IQ quant가 특히 느리다는 문제를 겨냥했습니다. 작성자는 EPYC 9654에서 24개 스레드를 사용하고 `--chunks 50`, batch size 512 조건으로 master와 PR을 비교했습니다. Qwen3.6-27B의 IQ3_S 처리량은 4.75 tok/s에서 65.45 tok/s로 올라 1277.9% 증가했으며, PPL은 6.4753에서 6.4779로 0.04%만 변했습니다.
02
Qwen3.6-27B에서는 IQ1부터 IQ4까지 각 텐서 형식을 완전히 실행하도록 pure 양자화 모델을 따로 만들었습니다. PR 적용 뒤 IQ1_M 처리량은 9.10 tok/s에서 69.59 tok/s로, IQ2_XXS는 7.21 tok/s에서 68.19 tok/s로 상승했으며 PPL 변화는 각각 +0.09%, -0.06%였습니다. 이는 큰 배치에서 속도를 높이면서 평가 수치의 변화는 측정 오차에 가까운 수준으로 유지한 결과입니다.
03
Qwen3.6-35B-A3B에서도 같은 방향의 개선이 반복됐지만 모델별 증가 폭은 달랐습니다. IQ1_S는 110.13 tok/s에서 245.92 tok/s로 123.3% 증가했고, IQ3_S는 74.47 tok/s에서 205.42 tok/s로 175.8% 증가했으며, IQ4_XS는 156.09 tok/s에서 245.02 tok/s로 57.0% 증가했습니다. 작성자는 실행 시간이 길어 수치가 약간 달라질 수 있지만 동일한 성능 향상이 반복됐다고 밝혔고, CPU의 대규모 배치 평가와 hybrid 처리에도 효과가 있을 가능성을 덧붙였습니다.

용어 해설

IQ 양자화(IQ quantization)
IQ 양자화는 모델 가중치를 낮은 비트 형식으로 압축해 메모리 사용량을 줄이는 방식입니다. 이 글에서는 IQ1부터 IQ4까지 여러 형식을 CPU의 대규모 배치 처리에 적용하고 속도와 PPL 변화를 비교합니다.
Perplexity
Perplexity는 언어 모델이 평가 데이터의 다음 토큰을 얼마나 잘 예측하는지 나타내는 지표입니다. 수치가 낮을수록 예측 오차가 작다는 뜻이며, 이 글에서는 PR 적용 전후의 양자화 품질 변화를 PPL로 비교합니다.
배치 크기(batch size)
배치 크기는 한 번의 처리 단계에서 함께 계산하는 입력 묶음의 크기입니다. 이 벤치마크는 batch size 512의 큰 배치에서 IQ 양자화 모델의 CPU 처리 속도를 측정했으며, 작은 배치에서는 증가 폭이 더 작다고 밝혔습니다.
imatrix
imatrix는 양자화 과정에서 모델의 중요도 정보를 활용하는 처리 맥락을 가리킵니다. 글의 문제 설정은 imatrix와 perplexity처럼 큰 배치가 필요한 CPU 작업에서 IQ quant의 속도가 특히 낮다는 점이며, 이를 PR의 성능 개선 대상으로 삼습니다.

언급된 도구

llama.cpp추천

IQ 양자화 모델의 CPU 대규모 배치 처리와 perplexity 성능을 비교하는 코드베이스입니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 20.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.