OpenVDN/vdn-minimax-h3
텍스트 프롬프트를 768p 동영상으로 변환하는 text-to-video 생성minimax-h3-community-license-agreement
MiniMax-H3 기반 hybrid attention으로 14.4초 영상을 11.23초에 생성
학습 방식 · MiniMax-H3 Transformer 가중치에서 시작해 frame-wise linear attention branch와 두 개의 LoRA adapter를 추가하고, 50-step 모델을 바탕으로 DMD 방식의 8-step 모델을 학습했습니다.
TL;DR
VDN-Minimax-H3는 MiniMax-H3를 기반으로 선형 Attention branch와 두 개의 LoRA adapter를 추가한 text-to-video 가속 Fine-tuning 모델입니다. 프레임 단위 linear attention이 계산량을 줄이고 softmax branch가 시각적 품질과 프레임 간 일관성을 보완하며, 추론 시 adapter를 backbone에 병합하되 원래 backbone 가중치는 수정하지 않습니다. 8개의 B200 GPU에서 8 denoising steps로 768p·14.4초 영상을 11.23초에 생성하며, 최적화된 추론 스택과 학습 코드도 함께 공개되어 고속 영상 생성 시스템 구축에 적합합니다.
핵심 포인트
- linear attention과 softmax branch를 결합해 속도와 영상 일관성을 함께 유지
- 두 개의 LoRA adapter와 별도 branch를 추론 중 병합해 backbone 가중치 수정 없이 적용
- B200 8개에서 8 NFE 기준 768p·14.4초 영상을 11.23초에 생성
- 8-step DMD 가중치와 50-step 모델, 최적화된 추론·학습 코드를 함께 제공
제한사항
- 성능 수치는 H200 또는 B200 GPU와 공개된 inference pipeline에서 측정됐으며 모델 로딩·워밍업·VAE decoding·MP4 encoding은 제외됐습니다.
- 전체 가중치 약 82GB를 내려받아야 하며, 첫 실행에서는 커널 컴파일에 수 분이 걸릴 수 있습니다.
- 프롬프트를 Qwen3-VL-32B VLM으로 먼저 인코딩해야 하므로 단일 text-to-video 호출보다 별도 전처리 단계가 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| 768p·14.4초 영상 생성, H200 8 GPU | 생성 시간 | 18.3초 | VDN-H3 FP8 Distributed 8 NFE; dense MiniMax-H3 1 GPU는 4.4분 |
| 768p·14.4초 영상 생성, B200 8 GPU | 생성 시간 | 11.23초 | VDN-H3 FP8 Distributed 8 NFE; dense MiniMax-H3 1 GPU는 2.23분 |
| 768p·14.4초 영상 생성, B200 1 GPU | 생성 시간 | 51초 | VDN-H3 FP8 8 NFE; dense MiniMax-H3 1 GPU는 2.23분 |
| 768p·14.4초 영상 생성, B200 8 GPU | 초당 NFE 처리 시간 | 1.40초 | VDN-H3 FP8 Distributed; dense MiniMax-H3 1 GPU는 16.74초 |
128
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.