본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Momoking/Qwen3-VL-32B-Heretic-MiniMax-H3-NVFP4

ComfyUI 기반 MiniMax-H3 video generation용 text encoding32Bapache-2.0

Qwen3-VL-32B 기반 MiniMax-H3 text encoder를 15.7GB NVFP4로 재양자화

학습 방식 · Qwen3-VL-32B 기반 MiniMax-H3 text encoder를 upstream INT8-ConvRot에서 NVFP4로 재양자화했으며, model.embed_tokens는 INT8로 유지했습니다.

TL;DR

이 모델은 Qwen3-VL-32B를 기반으로 MiniMax-H3의 uncensored text encoder를 NVFP4로 재양자화한 ComfyUI용 모델이다. 350개 linear layer는 group size 16 NVFP4로 저장하고, 778M 파라미터의 model.embed_tokens는 INT8로 유지해 파일 크기를 26.4GB에서 15.7GB로 줄였다. 16GB GPU에서 MiniMax-H3 영상 생성 workflow를 바꾸지 않고 사용할 수 있으며, 동일 prompt와 seed에서 upstream INT8-ConvRot 빌드와 시각적으로 동등한 결과를 냈다.

핵심 포인트

  • INT8-ConvRot 가중치의 Hadamard rotation을 되돌린 뒤 NVFP4로 재양자화해 conditioning 의미를 보존합니다.
  • 350개 linear layer는 NVFP4, model.embed_tokens는 INT8로 유지하는 mixed-precision 구성을 사용합니다.
  • 15.7GB 파일이 16GB 카드에 적재되며 CLIPLoader 경로만 교체하는 drop-in replacement입니다.
  • 동일 prompt와 seed에서 upstream INT8-ConvRot과 시각적으로 동등한 영상을 생성했습니다.

제한사항

  • NVFP4는 하드웨어 지원이 필요하며, 측정은 RTX PRO 2000 Blackwell(sm_120)에서 수행했습니다.
  • INT8에서 다시 양자화했기 때문에 upstream INT8 rounding을 물려받으며, BF16에서 직접 bake한 버전보다 품질이 덜 깨끗할 수 있습니다.
  • MiniMax-H3 diffusion model과 VAEs를 별도로 설치해야 하며, 동적 로딩 측정에서 encoder staged VRAM은 14.9GB, ComfyUI 프로세스 system RAM은 약 36GB였습니다.

벤치마크

벤치마크지표비교
모델 파일 크기저장 용량15.7 GBupstream Heretic INT8-ConvRot 26.4 GB 대비 감소
16GB GPU 적재단일 카드 적합 여부yesComfy-Org NVFP4 censored encoder와 동일한 15.7GB
MiniMax-H3 영상 생성peak VRAM during generation~9.9 GB1× RTX PRO 2000 Blackwell 16 GB에서 6 s, 480×864 vertical video와 audio 생성
upstream 출력 비교시각적 결과동일 prompt와 seed에서 visually equivalentupstream INT8-ConvRot 빌드와 비교한 측정 결과이며 NVFP4 버전 자체의 독립 점수가 아님

86

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.