alibaba-pai/MiniMax-H3-Fun-Controlnet-Union
MiniMax-H3에 다섯 종류의 ControlNet 제어와 video inpainting을 결합한 VideoX-Fun checkpoint
학습 방식 · MiniMax-H3 기반 VideoX-Fun ControlNet-Union 학습으로 Canny·Depth·HED·MLSD·Pose 제어와 video inpainting용 control branch를 추가한 guidance-distilled checkpoint이다.
TL;DR
이 모델은 독립적인 base 모델이 아니라 MiniMax-H3 위에 얹는 ControlNet-Union control branch이며, VideoX-Fun으로 학습한 video-to-video·video inpainting용 fine-tune 계열 checkpoint이다. 하나의 약 6.8GB safetensors 파일이 Canny, Depth, HED, MLSD, Pose 제어 영상을 공통으로 받아 50개 Transformer block 중 5개 지점에 zero-gated skip을 주입한다. Guidance-distilled 구조라 guidance_scale=1.0에서 step당 한 번만 추론하며, control_context_scale로 제어 강도를 조절한다. README에는 정량 benchmark 대신 40 inference steps와 seed 43으로 생성한 다섯 조건별 샘플이 제시됐고, 기본 MiniMax-H3와 약 124GB 규모의 Transformer·Qwen3-VL 메모리 요구량이 실제 사용 조건을 좌우한다.
핵심 포인트
- 단일 ControlNet-Union checkpoint가 Canny, Depth, HED, MLSD, Pose 제어 영상을 모두 처리한다. 조건마다 별도 checkpoint를 교체하지 않아도 된다. 하나의 VideoX-Fun 파이프라인으로 구조·깊이·윤곽·선분·동작 제어를 전환한다.
- 제어 분기는 50개 Transformer block 중 0, 10, 20, 30, 40번에 연결된다. 각 제어 skip은 zero-gated projection을 거쳐 주 분기에 더해진다. 제어 강도는 control_context_scale로 조절하며 1.0이 가장 강하고 0.0이면 분기를 끈다.
- Guidance-distilled 구조라 guidance_scale=1.0에서 동작한다. 각 step마다 한 번만 forward pass를 수행해 classifier-free guidance를 사용하지 않는다. 1보다 큰 값은 guidance를 중복 적용해 출력 품질을 떨어뜨린다.
- Video inpainting에서는 control_in_dim=49로 latent, masked latent, mask channel을 함께 입력한다. 프레임 수는 17 × n + 5 규칙에 맞춰 낮아지고 최대 15초, 24 fps로 처리된다. 80GB GPU 한 장에서는 model_group_offload 또는 model_cpu_offload_and_qfloat8이 필요하다.
제한사항
- 이 파일은 MiniMax-H3 전체 가중치가 아니라 control_proj_in과 5개 control block으로 구성된 약 6.8GB control branch만 포함한다. 추론 때 기본 MiniMax-H3 모델을 별도로 내려받아 model_name에 지정해야 한다. 기본 모델이 없으면 독립적인 video generator로 실행할 수 없다.
- 설정 파일은 학습 당시 구조와 정확히 맞아야 한다. control_blocks_places를 [0, 10, 20, 30, 40]으로 두고 control_in_dim=49, control_apply_audio=false를 사용해야 checkpoint가 로드된다. 80GB GPU에도 약 62GB Transformer와 약 62GB Qwen3-VL text encoder를 모두 올릴 수 없다.
- 생성 길이와 해상도는 입력 control video와 Video VAE 규칙에 제한된다. 프레임 수는 가장 큰 17 × n + 5 값으로 맞춰지고 길이는 15초, 출력은 24 fps로 고정된다. control video의 종횡비를 유지하면서 높이와 너비는 각각 32의 배수여야 한다.
83
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.