본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

TheTom/turboquant_plus

Python0 / 0

TurboQuant+는 PolarQuant와 Walsh-Hadamard 회전을 활용해 LLM의 KV 캐시를 최대 6.4배 압축하고, Sparse V 기법으로 추론 속도를 최적화하는 라이브러리이다.

핵심 포인트

  • KV 캐시를 3.8배에서 6.4배까지 압축하여 메모리 사용량 획기적 절감
  • Sparse V 기법으로 32K 컨텍스트에서 디코딩 속도 최대 22.8% 향상
  • 민감한 경계 레이어를 고정밀도로 보호하여 압축 품질 격차 최대 91% 회복
  • K와 V 캐시의 정밀도를 독립적으로 설정하는 비대칭 압축 모드로 모델별 최적화 가능

5.2k

STARS

707

FORKS

+538

TRENDING

0

조회수

watchers 5.2kopen issues 32Apache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.