MATLOWAI/minimax-h3-fused-turbo-int8-convrot
MiniMax-H3에 Turbo·motion LoRA를 병합하고 ConvRot INT8로 양자화한 ComfyUI용 영상·음성 생성 모델
학습 방식 · MiniMax-H3 Pruned fl2va Transformer 기반 merge에 ref2va-fl2va rank-1024 SVD delta를 결합하고, LightX2V FL2VA Turbo 8-step LoRA와 Mystic v2.0 motion-smoothing LoRA를 병합한 뒤 ConvRot 방식의 per-channel INT8 양자화를 적용했습니다.
TL;DR
MATLOWAI/minimax-h3-fused-turbo-int8-convrot는 MiniMax-H3 계열의 merge·INT8 양자화 모델로, text/image-to-video와 reference-to-video를 하나의 21 GB ComfyUI 파일에서 처리합니다. Pruned fl2va Transformer에 ref2va와 fl2va의 weight delta를 rank-1024 SVD 방식으로 결합해 first/last-frame 조건과 reference 조건을 단일 파티션으로 통합했습니다. 여기에 8-step LightX2V Turbo와 Mystic v2.0 motion-smoothing LoRA를 병합한 뒤 qkv_proj, out_proj, fc1, fc2를 ConvRot INT8로 한 차례 양자화해 로딩 시 LoRA 백업 메모리를 줄였습니다. 1152×640 해상도에서 243프레임을 4단계로 생성하는 reference-to-video 경로가 76초에 실행되며, 동기화된 영상·음성 생성과 16 GB급 저VRAM 경로를 함께 제공합니다.
핵심 포인트
- ref2va와 fl2va weight delta를 rank-1024 SVD로 결합해 first/last-frame과 reference 조건을 한 Transformer에서 처리합니다.
- LightX2V 8-step Turbo와 Mystic v2.0을 병합해 4단계 생성 경로와 motion smoothing을 기본 가중치에 포함합니다.
- 50개 블록의 네 가지 대형 Linear weight만 ConvRot INT8로 양자화해 21 GB 파일과 ComfyUI 기본 UNETLoader를 사용합니다.
- SLA block-sparse attention과 audio VAE를 결합해 1152×640·243프레임 영상을 생성하며 음성 세부와 처리 시간을 함께 관리합니다.
제한사항
- Mystic v2.0과 motion adapter는 stylised 2D 콘텐츠에서 photographic shading 편향을 만들 수 있으며, warm375는 고정 영역에서 피사체를 중복시키는 문제가 보고됐습니다.
- 병합 파일은 LoRA를 가중치에 접어 넣었으므로 생성 시 LoRA 강도를 조절하거나 제거할 수 없으며, 조절이 필요하면 live-LoRA 경로를 사용해야 합니다.
- SLA attention은 별도 ComfyUI 노드 팩이 필요하고 AMD·ROCm 환경에서는 patientx의 ComfyUI ROCm fork와 전용 그래프가 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| reference-to-video 1152×640·243프레임·4단계 | wall time | 76 s | RTX PRO 6000 96 GB, seed 42, SLA sparse attention 기준 |
| reference-to-video 1152×640·243프레임·6단계 | wall time | 80 s | 동일 prompt·seed·하드웨어에서 4단계 경로는 76 s |
| reference-to-video 1152×640·243프레임·8단계 | wall time | 103 s | 동일 prompt·seed·하드웨어에서 live-LoRA 8단계 경로도 103 s이며 baked 모델과 같은 take |
| reference-to-video 1152×640·243프레임·25단계 | wall time | 292 s | 동일 prompt·seed·하드웨어에서 4+4 de-rope는 cold 기준 ~374 s이며 held region을 정리하는 별도 경로 |
| 표준 reference 저VRAM 그래프 | peak VRAM / wall time | 11.0 GiB / 65 s | 96 GB 카드에서 메모리를 제한한 16 GB 환경, 4단계·SLA 기준 |
| 저VRAM FFN chunker 그래프 | peak VRAM / wall time | 10.9 GiB / 59 s | 표준 저VRAM 그래프 대비 peak VRAM 0.1 GiB, wall time 6 s 감소; 동일 seed에서 bit-identical 출력 |
75
LIKES
3.5k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.