섹션별 상세
GLQ는 8차원 E8 격자의 65,536개 벡터를 코드북으로 사용하여 가중치를 16비트 인덱스로 인코딩한다.
Randomized Hadamard Transform을 적용하여 Hessian을 대각화함으로써, 유클리드 최근접 이웃 탐색이 양자화 오차를 최소화하도록 설계되었다.
가중치 행렬을 메모리에 복원하지 않고 압축된 인덱스에서 직접 연산하는 융합 CUDA 커널을 사용하여 추론 효율을 높인다.
vLLM과 통합된 E8 격자 기반 KV 캐시 압축을 지원하여, 긴 컨텍스트 처리 시 메모리 사용량을 fp16 대비 약 25% 수준으로 줄인다.
근거
- E8 격자 기반 KV 캐시 압축은 fp16 대비 메모리 사용량을 약 25% 수준으로 줄인다. — KV cache compression 섹션
SmolLM3-3B 모델 기준, 4.5 bpw 설정에서 GPTQ 대비 10/12개 벤치마크 지표에서 우수한 성능을 기록했다.
근거
- GLQ 4.5 bpw는 GPTQ 대비 10/12개 벤치마크 지표에서 우수한 성능을 기록했다. — Results 섹션의 벤치마크 표
기술
- GLQ
- PyTorch
- vLLM
- Hugging Face Transformers
- CUDA
- Triton
활용 사례
- LLM 가중치 압축
- KV 캐시 메모리 최적화
- 긴 컨텍스트 추론 서비스
언급된 리소스
GitHubGLQ GitHub Repository
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 06. 02.수집 2026. 06. 02.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
