본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

MATLOWAI/minimax-h3-fused-turbo-int8-convrot

텍스트·이미지·참조 이미지 기반 영상 및 동기화 오디오 생성minimax-h3-community-license-agreement

MiniMax-H3에 Turbo·motion LoRA를 병합하고 ConvRot INT8로 양자화한 ComfyUI용 영상·음성 생성 모델

학습 방식 · MiniMax-H3 Pruned fl2va Transformer 기반 merge에 ref2va-fl2va rank-1024 SVD delta를 결합하고, LightX2V FL2VA Turbo 8-step LoRA와 Mystic v2.0 motion-smoothing LoRA를 병합한 뒤 ConvRot 방식의 per-channel INT8 양자화를 적용했습니다.

TL;DR

MATLOWAI/minimax-h3-fused-turbo-int8-convrot는 MiniMax-H3 계열의 merge·INT8 양자화 모델로, text/image-to-video와 reference-to-video를 하나의 21 GB ComfyUI 파일에서 처리합니다. Pruned fl2va Transformer에 ref2va와 fl2va의 weight delta를 rank-1024 SVD 방식으로 결합해 first/last-frame 조건과 reference 조건을 단일 파티션으로 통합했습니다. 여기에 8-step LightX2V Turbo와 Mystic v2.0 motion-smoothing LoRA를 병합한 뒤 qkv_proj, out_proj, fc1, fc2를 ConvRot INT8로 한 차례 양자화해 로딩 시 LoRA 백업 메모리를 줄였습니다. 1152×640 해상도에서 243프레임을 4단계로 생성하는 reference-to-video 경로가 76초에 실행되며, 동기화된 영상·음성 생성과 16 GB급 저VRAM 경로를 함께 제공합니다.

핵심 포인트

  • ref2va와 fl2va weight delta를 rank-1024 SVD로 결합해 first/last-frame과 reference 조건을 한 Transformer에서 처리합니다.
  • LightX2V 8-step Turbo와 Mystic v2.0을 병합해 4단계 생성 경로와 motion smoothing을 기본 가중치에 포함합니다.
  • 50개 블록의 네 가지 대형 Linear weight만 ConvRot INT8로 양자화해 21 GB 파일과 ComfyUI 기본 UNETLoader를 사용합니다.
  • SLA block-sparse attention과 audio VAE를 결합해 1152×640·243프레임 영상을 생성하며 음성 세부와 처리 시간을 함께 관리합니다.

제한사항

  • Mystic v2.0과 motion adapter는 stylised 2D 콘텐츠에서 photographic shading 편향을 만들 수 있으며, warm375는 고정 영역에서 피사체를 중복시키는 문제가 보고됐습니다.
  • 병합 파일은 LoRA를 가중치에 접어 넣었으므로 생성 시 LoRA 강도를 조절하거나 제거할 수 없으며, 조절이 필요하면 live-LoRA 경로를 사용해야 합니다.
  • SLA attention은 별도 ComfyUI 노드 팩이 필요하고 AMD·ROCm 환경에서는 patientx의 ComfyUI ROCm fork와 전용 그래프가 필요합니다.

벤치마크

벤치마크지표비교
reference-to-video 1152×640·243프레임·4단계wall time76 sRTX PRO 6000 96 GB, seed 42, SLA sparse attention 기준
reference-to-video 1152×640·243프레임·6단계wall time80 s동일 prompt·seed·하드웨어에서 4단계 경로는 76 s
reference-to-video 1152×640·243프레임·8단계wall time103 s동일 prompt·seed·하드웨어에서 live-LoRA 8단계 경로도 103 s이며 baked 모델과 같은 take
reference-to-video 1152×640·243프레임·25단계wall time292 s동일 prompt·seed·하드웨어에서 4+4 de-rope는 cold 기준 ~374 s이며 held region을 정리하는 별도 경로
표준 reference 저VRAM 그래프peak VRAM / wall time11.0 GiB / 65 s96 GB 카드에서 메모리를 제한한 16 GB 환경, 4단계·SLA 기준
저VRAM FFN chunker 그래프peak VRAM / wall time10.9 GiB / 59 s표준 저VRAM 그래프 대비 peak VRAM 0.1 GiB, wall time 6 s 감소; 동일 seed에서 bit-identical 출력

75

LIKES

3.5k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.