mvp-lab/MiniMax-H3-RAVEN-Streaming-LoRA
텍스트 조건에 따른 실시간·스트리밍 비디오 생성minimax-h3-community-license-agreement
MiniMax-H3에 LoRA를 적용해 4 NFE causal streaming video를 생성하는 preview adapter
학습 방식 · MiniMaxAI/MiniMax-H3에 LoRA adapter를 학습해 RAVEN의 causal chunk extrapolation과 4-NFE streaming generation 경로를 구현했으며, README는 이 adapter가 논문 평가 모델에는 포함되지 않았다고 밝힙니다.
TL;DR
이 모델은 MiniMaxAI/MiniMax-H3를 기반으로 한 LoRA adapter이며, 일반적인 전체 클립 denoising 대신 앞서 생성한 비디오를 chunk 단위로 이어 가는 causal streaming generator로 변환합니다. 4 NFE에서 비디오와 오디오 grid를 처리하고, 공개 설정은 192 frames·24 fps·768 × 1376 해상도입니다. ComfyUI 경로는 24 GiB VRAM에서 192-frame 1376×768 T2VA 생성을 지원하지만 system RAM 부담이 크고 추가 inference acceleration이 필요합니다. 아직 preview 단계라 texture detail이 제한적이며, 이 adapter는 RAVEN 논문 평가 모델에 포함되지 않았습니다.
핵심 포인트
- MiniMax-H3를 LoRA adapter로 causal streaming generator로 바꿉니다. 비디오는 전체 클립을 한 번에 양방향 denoising하지 않습니다. 이전에 생성한 내용을 바탕으로 chunk 단위 extrapolation을 수행합니다.
- 4 NFE 설정으로 비디오와 오디오 grid를 샘플링합니다. causal chunking은 sink=2와 window=2를 사용합니다. 공개 설정은 192 frames, 24 fps, 768 × 1376 해상도입니다.
- LoRA 설정은 r=128과 lora_alpha=128입니다. ComfyUI 경로에서는 24 GiB VRAM 안에서 192-frame 1376×768 T2VA 생성을 지원합니다. 다만 실시간 생성에는 추가 inference acceleration이 필요합니다.
제한사항
- 이 가중치는 initial preview이며 LoRA adapter가 아직 undertrained 상태입니다. 그 결과 texture detail이 제한적입니다. README는 학습부터 생성까지의 end-to-end pipeline을 검증했지만 최종 품질을 보장하지 않습니다.
- 모델 규모가 커서 현재 설정만으로 real-time generation을 달성하기 어렵습니다. ComfyUI 경로는 24 GiB VRAM 범위를 제시하지만 system RAM 수요가 상당합니다. 추가 inference acceleration과 memory optimization이 필요합니다.
- 긴 생성에는 capped RoPE 같은 training-free extension을 사용할 수 있습니다. 그러나 제작진은 이 기능을 아직 테스트하지 않았습니다. 따라서 long generation의 실제 품질과 안정성은 README에서 확인되지 않습니다.
72
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.