본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

OpenVDN/vdn-minimax-h3

텍스트 프롬프트를 768p 동영상으로 변환하는 text-to-video 생성minimax-h3-community-license-agreement

MiniMax-H3 기반 hybrid attention으로 14.4초 영상을 11.23초에 생성

학습 방식 · MiniMax-H3 Transformer 가중치에서 시작해 frame-wise linear attention branch와 두 개의 LoRA adapter를 추가하고, 50-step 모델을 바탕으로 DMD 방식의 8-step 모델을 학습했습니다.

TL;DR

VDN-Minimax-H3는 MiniMax-H3를 기반으로 선형 Attention branch와 두 개의 LoRA adapter를 추가한 text-to-video 가속 Fine-tuning 모델입니다. 프레임 단위 linear attention이 계산량을 줄이고 softmax branch가 시각적 품질과 프레임 간 일관성을 보완하며, 추론 시 adapter를 backbone에 병합하되 원래 backbone 가중치는 수정하지 않습니다. 8개의 B200 GPU에서 8 denoising steps로 768p·14.4초 영상을 11.23초에 생성하며, 최적화된 추론 스택과 학습 코드도 함께 공개되어 고속 영상 생성 시스템 구축에 적합합니다.

핵심 포인트

  • linear attention과 softmax branch를 결합해 속도와 영상 일관성을 함께 유지
  • 두 개의 LoRA adapter와 별도 branch를 추론 중 병합해 backbone 가중치 수정 없이 적용
  • B200 8개에서 8 NFE 기준 768p·14.4초 영상을 11.23초에 생성
  • 8-step DMD 가중치와 50-step 모델, 최적화된 추론·학습 코드를 함께 제공

제한사항

  • 성능 수치는 H200 또는 B200 GPU와 공개된 inference pipeline에서 측정됐으며 모델 로딩·워밍업·VAE decoding·MP4 encoding은 제외됐습니다.
  • 전체 가중치 약 82GB를 내려받아야 하며, 첫 실행에서는 커널 컴파일에 수 분이 걸릴 수 있습니다.
  • 프롬프트를 Qwen3-VL-32B VLM으로 먼저 인코딩해야 하므로 단일 text-to-video 호출보다 별도 전처리 단계가 필요합니다.

벤치마크

벤치마크지표비교
768p·14.4초 영상 생성, H200 8 GPU생성 시간18.3초VDN-H3 FP8 Distributed 8 NFE; dense MiniMax-H3 1 GPU는 4.4분
768p·14.4초 영상 생성, B200 8 GPU생성 시간11.23초VDN-H3 FP8 Distributed 8 NFE; dense MiniMax-H3 1 GPU는 2.23분
768p·14.4초 영상 생성, B200 1 GPU생성 시간51초VDN-H3 FP8 8 NFE; dense MiniMax-H3 1 GPU는 2.23분
768p·14.4초 영상 생성, B200 8 GPU초당 NFE 처리 시간1.40초VDN-H3 FP8 Distributed; dense MiniMax-H3 1 GPU는 16.74초

128

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.