Momoking/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4
ComfyUI 기반 MiniMax-H3 video generation용 text encoding32Bapache-2.0
Qwen3-VL-32B 기반 MiniMax-H3 text encoder를 15.7GB NVFP4로 재양자화
학습 방식 · Qwen3-VL-32B 기반 MiniMax-H3 text encoder를 upstream INT8-ConvRot에서 NVFP4로 재양자화했으며, model.embed_tokens는 INT8로 유지했습니다.
TL;DR
이 모델은 Qwen3-VL-32B를 기반으로 MiniMax-H3의 uncensored text encoder를 NVFP4로 재양자화한 ComfyUI용 모델이다. 350개 linear layer는 group size 16 NVFP4로 저장하고, 778M 파라미터의 model.embed_tokens는 INT8로 유지해 파일 크기를 26.4GB에서 15.7GB로 줄였다. 16GB GPU에서 MiniMax-H3 영상 생성 workflow를 바꾸지 않고 사용할 수 있으며, 동일 prompt와 seed에서 upstream INT8-ConvRot 빌드와 시각적으로 동등한 결과를 냈다.
핵심 포인트
- INT8-ConvRot 가중치의 Hadamard rotation을 되돌린 뒤 NVFP4로 재양자화해 conditioning 의미를 보존합니다.
- 350개 linear layer는 NVFP4, model.embed_tokens는 INT8로 유지하는 mixed-precision 구성을 사용합니다.
- 15.7GB 파일이 16GB 카드에 적재되며 CLIPLoader 경로만 교체하는 drop-in replacement입니다.
- 동일 prompt와 seed에서 upstream INT8-ConvRot과 시각적으로 동등한 영상을 생성했습니다.
제한사항
- NVFP4는 하드웨어 지원이 필요하며, 측정은 RTX PRO 2000 Blackwell(sm_120)에서 수행했습니다.
- INT8에서 다시 양자화했기 때문에 upstream INT8 rounding을 물려받으며, BF16에서 직접 bake한 버전보다 품질이 덜 깨끗할 수 있습니다.
- MiniMax-H3 diffusion model과 VAEs를 별도로 설치해야 하며, 동적 로딩 측정에서 encoder staged VRAM은 14.9GB, ComfyUI 프로세스 system RAM은 약 36GB였습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| 모델 파일 크기 | 저장 용량 | 15.7 GB | upstream Heretic INT8-ConvRot 26.4 GB 대비 감소 |
| 16GB GPU 적재 | 단일 카드 적합 여부 | yes | Comfy-Org NVFP4 censored encoder와 동일한 15.7GB |
| MiniMax-H3 영상 생성 | peak VRAM during generation | ~9.9 GB | 1× RTX PRO 2000 Blackwell 16 GB에서 6 s, 480×864 vertical video와 audio 생성 |
| upstream 출력 비교 | 시각적 결과 | 동일 prompt와 seed에서 visually equivalent | upstream INT8-ConvRot 빌드와 비교한 측정 결과이며 NVFP4 버전 자체의 독립 점수가 아님 |
86
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.