TheTom/turboquant_plus
Python0 / 0
TurboQuant+는 PolarQuant와 Walsh-Hadamard 회전을 활용해 LLM의 KV 캐시를 최대 6.4배 압축하고, Sparse V 기법으로 추론 속도를 최적화하는 라이브러리이다.
핵심 포인트
- KV 캐시를 3.8배에서 6.4배까지 압축하여 메모리 사용량 획기적 절감
- Sparse V 기법으로 32K 컨텍스트에서 디코딩 속도 최대 22.8% 향상
- 민감한 경계 레이어를 고정밀도로 보호하여 압축 품질 격차 최대 91% 회복
- K와 V 캐시의 정밀도를 독립적으로 설정하는 비대칭 압축 모드로 모델별 최적화 가능
5.2k
STARS
707
FORKS
+538
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.