본문으로 건너뛰기
HF Daily Papers조회 3

초기화가 분지를 결정한다: 극한의 LLM 양자화를 위한 효율적인 코드북 최적화

대형 언어 모델을 스마트폰이나 CPU 환경에서 실행하려면 2비트 수준의 극한 압축이 필요하지만, 기존 방식은 성능이 급격히 떨어지는 문제가 있었다. 이 논문은 복잡한 계산을 늘리는 대신 '초기 설정'이라는 근본적인 병목을 해결하여, 추가 연산 비용 없이도 압축 모델의 품질을 획기적으로 높이는 방법을 제시한다.

용어 해설

가산 양자화(Additive Quantization)
가중치 그룹을 여러 코드북에서 선택한 코드워드들의 합으로 표현하는 압축 방식이다. 조회 테이블(LUT)만으로 복원이 가능해 연산 자원이 부족한 엣지 기기에서 매우 효율적이다.
코드북 초기화(Codebook Initialization)
양자화 과정에서 가중치를 대표할 최적의 값(코드워드)들을 처음 설정하는 단계이다. 초기 설정이 잘못되면 이후의 복잡한 최적화 알고리즘으로도 성능을 회복하기 어렵다.
헤시안 가중 마할라노비스 거리(Hessian-weighted Mahalanobis Distance)
가중치 오차가 모델의 최종 출력에 미치는 민감도(Hessian)를 반영하여 거리를 측정하는 방식이다. 단순 수치 차이보다 실제 모델 성능에 중요한 가중치를 더 정확하게 보존하게 돕는다.
퍼플렉서티(Perplexity)
언어 모델이 다음 토큰을 얼마나 잘 예측하는지 나타내는 지표로, 값이 낮을수록 모델의 언어 이해 능력이 뛰어남을 의미한다. 양자화로 인한 성능 저하를 측정하는 핵심 척도이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 09.수집 2026. 04. 14.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.