ComfyUI에서 2배~11배 빠른 확산 모델 추론을 구현하는 QuantFunc
AI Tool·Python0 / 0
ComfyUI에서 SVDQ 및 Lighting 엔진을 통해 확산 모델의 추론 속도를 2배에서 11배까지 가속하고, LoRA 융합 및 런타임 양자화를 수행하는 고성능 추론 플러그인.
주요 기능
- SVDQ 및 Lighting 엔진을 사용하여 확산 모델 추론 속도를 2배~11배 향상한다.
- LoRA 가중치를 모델에 영구적으로 융합하여 추론 시 추가 오버헤드를 제거한다.
- RTX 20/30/40/50 시리즈 및 최신 Blackwell 아키텍처에서 네이티브 FP4 연산을 수행한다.
- 런타임 양자화된 모델을 디스크로 내보내어 재양자화 과정 없이 즉시 로드한다.
어떻게 동작하는가
C++/CUDA 기반의 libquantfunc 라이브러리를 통해 모델을 4비트로 양자화하고, SVDQ와 Lighting 엔진을 사용하여 GPU에서 직접 추론을 실행한다.
910
Stars
22
Forks
+232
Trending
0
조회수
910 watchers4 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.