본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

alibaba-pai/MiniMax-H3-Fun-Controlnet-Union

ControlNet 조건을 이용한 video-to-video 생성과 video inpaintingminimax-h3-community-license-agreement

MiniMax-H3에 다섯 종류의 ControlNet 제어와 video inpainting을 결합한 VideoX-Fun checkpoint

학습 방식 · MiniMax-H3 기반 VideoX-Fun ControlNet-Union 학습으로 Canny·Depth·HED·MLSD·Pose 제어와 video inpainting용 control branch를 추가한 guidance-distilled checkpoint이다.

TL;DR

이 모델은 독립적인 base 모델이 아니라 MiniMax-H3 위에 얹는 ControlNet-Union control branch이며, VideoX-Fun으로 학습한 video-to-video·video inpainting용 fine-tune 계열 checkpoint이다. 하나의 약 6.8GB safetensors 파일이 Canny, Depth, HED, MLSD, Pose 제어 영상을 공통으로 받아 50개 Transformer block 중 5개 지점에 zero-gated skip을 주입한다. Guidance-distilled 구조라 guidance_scale=1.0에서 step당 한 번만 추론하며, control_context_scale로 제어 강도를 조절한다. README에는 정량 benchmark 대신 40 inference steps와 seed 43으로 생성한 다섯 조건별 샘플이 제시됐고, 기본 MiniMax-H3와 약 124GB 규모의 Transformer·Qwen3-VL 메모리 요구량이 실제 사용 조건을 좌우한다.

핵심 포인트

  • 단일 ControlNet-Union checkpoint가 Canny, Depth, HED, MLSD, Pose 제어 영상을 모두 처리한다. 조건마다 별도 checkpoint를 교체하지 않아도 된다. 하나의 VideoX-Fun 파이프라인으로 구조·깊이·윤곽·선분·동작 제어를 전환한다.
  • 제어 분기는 50개 Transformer block 중 0, 10, 20, 30, 40번에 연결된다. 각 제어 skip은 zero-gated projection을 거쳐 주 분기에 더해진다. 제어 강도는 control_context_scale로 조절하며 1.0이 가장 강하고 0.0이면 분기를 끈다.
  • Guidance-distilled 구조라 guidance_scale=1.0에서 동작한다. 각 step마다 한 번만 forward pass를 수행해 classifier-free guidance를 사용하지 않는다. 1보다 큰 값은 guidance를 중복 적용해 출력 품질을 떨어뜨린다.
  • Video inpainting에서는 control_in_dim=49로 latent, masked latent, mask channel을 함께 입력한다. 프레임 수는 17 × n + 5 규칙에 맞춰 낮아지고 최대 15초, 24 fps로 처리된다. 80GB GPU 한 장에서는 model_group_offload 또는 model_cpu_offload_and_qfloat8이 필요하다.

제한사항

  • 이 파일은 MiniMax-H3 전체 가중치가 아니라 control_proj_in과 5개 control block으로 구성된 약 6.8GB control branch만 포함한다. 추론 때 기본 MiniMax-H3 모델을 별도로 내려받아 model_name에 지정해야 한다. 기본 모델이 없으면 독립적인 video generator로 실행할 수 없다.
  • 설정 파일은 학습 당시 구조와 정확히 맞아야 한다. control_blocks_places를 [0, 10, 20, 30, 40]으로 두고 control_in_dim=49, control_apply_audio=false를 사용해야 checkpoint가 로드된다. 80GB GPU에도 약 62GB Transformer와 약 62GB Qwen3-VL text encoder를 모두 올릴 수 없다.
  • 생성 길이와 해상도는 입력 control video와 Video VAE 규칙에 제한된다. 프레임 수는 가장 큰 17 × n + 5 값으로 맞춰지고 길이는 15초, 출력은 24 fps로 고정된다. control video의 종횡비를 유지하면서 높이와 너비는 각각 32의 배수여야 한다.

83

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.