본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

joeygambino/MiniMax-H3-x-Z-Image-native

텍스트 조건으로 영상과 오디오·비디오 결과를 생성하는 text-to-video 모델입니다.minimax-h3-community-license

MiniMax-H3 엔진에 Z-Image의 공간 주의 특성을 결합해 장면 질감과 디테일을 강화한 ComfyUI용 text-to-video merge 모델

학습 방식 · MiniMaxAI/MiniMax-H3를 기반으로 Z-Image의 spatial-attention 프로파일을 graft하고, late-block에 zs05 dose 0.5를 적용한 merge 방식입니다.

TL;DR

이 모델은 MiniMaxAI/MiniMax-H3를 기반으로 Z-Image의 spatial-attention 특성을 이식한 comfy-native merge 모델입니다. H3의 영상 생성 엔진에 graft를 적용해 장면 구성과 질감을 더 풍부하게 만들면서 동일 인물의 정체성을 유지하고, 샷마다 선명도가 누적되는 sharpening creep을 피하도록 설계됐습니다. bf16 master와 FP8·INT8·4-bit 양자화 빌드를 제공하며, 16GB 카드에는 comfy-w4a8가 품질 선택지이고 Blackwell GPU에는 nvfp4가 맞습니다. ComfyUI 0.32 이상에서 Load Diffusion Model 노드로 사용할 수 있지만 GPU 아키텍처에 따라 속도와 양자화 효율이 크게 달라집니다.

핵심 포인트

  • MiniMax-H3의 생성 엔진에 Z-Image의 spatial-attention 특성을 결합한 merge 모델입니다.
  • 장면의 세부 묘사와 질감을 강화하면서 동일 인물의 정체성과 일관성을 유지하도록 설계됐습니다.
  • bf16부터 FP8·INT8·4-bit까지 ComfyUI 환경과 GPU 메모리에 맞춘 빌드를 제공합니다.
  • ComfyUI 0.32 이상에서 Load Diffusion Model 노드로 직접 불러올 수 있습니다.

제한사항

  • 4-bit 계열은 16GB 그래픽카드에 맞춘 대신 빌드별 품질과 실행 특성이 다릅니다. comfy-w4a8는 품질 우선 선택지이고 nvfp4는 Blackwell에서 native로 동작하지만 다른 아키텍처에서는 에뮬레이션됩니다. 따라서 GPU 세대와 메모리에 따라 적합한 양자화 형식을 골라야 합니다.
  • 하드웨어별 처리 속도 차이가 커서 모든 GPU에서 동일한 성능을 기대하기 어렵습니다. README는 RTX 30·40에서 GGUF 저장소가 Ampere의 4-bit comfy-native 빌드보다 4~8배 빠르다고 밝힙니다. 구형 아키텍처에서는 comfy-mxfp8의 이점도 작다고 명시돼 있습니다.

78

LIKES

13.3k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.