alibaba-pai/MiniMax-H3-Acc-LoRAs
텍스트 프롬프트를 바탕으로 동영상을 생성하며 FL2VA와 Ref2VA 입력 방식을 지원합니다.minimax-h3-community-license-agreement
MiniMax-H3에 PDD Acc LoRA를 더해 8 NFE 동영상 생성을 지원하는 VideoX-Fun 체크포인트
학습 방식 · MiniMax-H3의 FL2VA·Ref2VA 경로에 Parallel Decoding Distillation을 적용한 공식 Acc LoRA이며, 두 파일 모두 rank=64와 network_alpha=64의 BF16 설정입니다.
TL;DR
MiniMax-H3-Acc-LoRAs는 MiniMaxAI/MiniMax-H3를 기반으로 한 text-to-video 가속 LoRA이며, 일반적인 base 모델이나 완전한 Fine-tune 모델이 아닙니다. Parallel Decoding Distillation을 통해 여러 단계의 추론 부담을 줄이고 8 NFE 생성에 맞춘 보정 가중치를 적용합니다. FL2VA와 Ref2VA에 맞춘 BF16 체크포인트를 각각 제공하며, VideoX-Fun의 apply_pdd_lora가 LoRA 설정을 읽어 필요한 추론 단계 수를 구성합니다. 비교 예시는 768p와 4·8 NFE 조건을 포함하지만 정량적 품질 점수나 처리 시간은 README에 없습니다.
핵심 포인트
- MiniMax-H3용 가속 LoRA로 설계됐습니다. 기본 가중치 전체를 바꾸지 않고 추론 과정을 보정합니다. 기존 모델에 체크포인트를 추가해 사용합니다.
- Parallel Decoding Distillation을 적용해 적은 추론 단계에서 동영상을 생성합니다. 공식 가속 LoRA는 8 NFE 구성을 목표로 합니다. FL2VA와 Ref2VA용 파일이 각각 제공됩니다.
- 두 체크포인트 모두 rank=64, network_alpha=64인 BF16 LoRA입니다. FL2VA는 768p 예시와 함께 제공됩니다. Ref2VA는 참조 영상을 활용하는 생성 경로에 맞춰져 있습니다.
- VideoX-Fun 예제는 MiniMax-H3 가중치와 대응하는 LoRA를 함께 불러옵니다. apply_pdd_lora가 체크포인트 설정에서 필요한 추론 단계 수를 읽습니다. Diffusers의 ModularPipeline을 통해 실행합니다.
제한사항
- 기본 모델과 입력 경로에 맞는 LoRA 체크포인트를 선택해야 합니다. FL2VA에는 MiniMax-H3-FL2VA-Acc-8Step.safetensors를 사용합니다. Ref2VA에는 MiniMax-H3-Ref2VA-Acc-8Step.safetensors를 사용합니다.
- 실행 예제는 Diffusers >= 0.40.0을 요구합니다. VideoX-Fun의 predict_t2v.py 또는 predict_ref2v.py 경로를 사용해야 합니다. README에는 GPU 메모리 요구량이나 처리 시간 수치가 없습니다.
- README의 비교 영상은 Minimax-H3-Turbo 테스트 케이스를 바탕으로 생성됐습니다. LoRA weight는 1.0이며 4와 8 NFE에서 생성됐습니다. 별도의 정량적 화질 벤치마크 수치는 공개되지 않았습니다.
108
LIKES
609
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.