104B 모델을 맥북에서? KV 캐시를 6배 압축하는 TurboQuant+
Infrastructure·Python5 / 0
TurboQuant+는 PolarQuant와 Walsh-Hadamard 회전을 활용해 LLM의 KV 캐시를 최대 6.4배 압축하고, Sparse V 기법으로 추론 속도를 최적화하는 라이브러리이다.
주요 기능
- KV 캐시를 3.8배에서 6.4배까지 압축하여 메모리 사용량 획기적 절감
- Sparse V 기법으로 32K 컨텍스트에서 디코딩 속도 최대 22.8% 향상
- 민감한 경계 레이어를 고정밀도로 보호하여 압축 품질 격차 최대 91% 회복
- K와 V 캐시의 정밀도를 독립적으로 설정하는 비대칭 압축 모드로 모델별 최적화 가능
- Apple Silicon Metal 커널 최적화를 통해 q8_0 수준의 프리필 속도 달성
어떻게 동작하는가
Walsh-Hadamard 회전으로 KV 텐서를 가우시안 분포로 변환한 뒤 PolarQuant로 양자화하며, 어텐션 가중치를 게이팅 신호로 활용해 중요도가 낮은 V 캐시의 복원 연산을 건너뛰는 방식으로 작동한다.
5.2k
Stars
707
Forks
+538
Trending
5
조회수
5.2k watchers32 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.