Smite79/MiniMax-H3-Longvideos
단일 prompt 기반 동기화 영상·오디오 생성
MiniMax-H3의 shot을 이전 frame과 연결해 영상·오디오 연속성을 유지하는 ComfyUI node
TL;DR
Smite79/MiniMax-H3-Longvideos는 MiniMax-H3를 ComfyUI에서 장면 단위로 이어 붙이는 custom node입니다. 한 문단을 한 shot으로 나누고, 각 shot의 길이를 동작량에 맞춰 계산한 뒤 이전 shot의 마지막 frame을 다음 shot의 keyframe으로 전달합니다. character_memory와 의상·소품 추적을 함께 사용해 인물과 장면 요소의 연속성을 유지하며, 대사가 없는 shot은 음성을 끄고 ambient bed를 shot 사이에 이어 붙입니다. FL2VA와 REF2VA conditioning을 하나의 node에서 처리하므로 동기화된 영상과 오디오를 단일 prompt에서 생성하는 MiniMax-H3 workflow에 적합합니다.
핵심 포인트
- 문단별 beat를 shot으로 분리하고 동작량에 따라 shot 길이를 계산해 반복·역재생 위험을 줄입니다.
- 이전 shot의 마지막 frame을 다음 shot의 keyframe으로 전달하고 character_memory로 인물·의상·소품을 추적합니다.
- 대사가 없는 shot은 자동 음소거하며 ambient bed의 음량과 연결 상태를 유지해 장면 전환 시 음향 변화를 줄입니다.
- cfg 1.0의 CFG-free MiniMax-H3에 맞춰 negative prompt 없이 video·audio shift를 약 4:1로 설정합니다.
제한사항
- ComfyUI 0.31 이상과 native MiniMax-H3 지원이 필요하며, README는 0.33에서 테스트됐다고 밝힙니다.
- shot 비용은 latent cell 수와 duration에 좌우되고 attention은 이에 대해 quadratic하게 증가하므로 긴 고해상도 생성은 VRAM 부담이 큽니다.
- PDD Acc LoRA, latent upscaler, SLA attention은 별도 third-party pack이 필요하고, LoRA는 checkpoint shape가 맞지 않으면 실행되지 않습니다.
83
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.