smhfacct/Minimax-H3-fl2va-ref2va-hybrid-models
참조 이미지·영상·음성을 활용한 text-to-video 생성other
fl2va 품질에 ref2va 참조 조건을 결합한 MiniMax H3 merge 모델
학습 방식 · MiniMax H3 fl2va를 기반으로 ref2va의 후반부 adaln_proj를 블록 범위별로 선택한 weight-selection merge이며, pruned int8-convrot base 모델에서 추가 학습이나 Fine-tuning 없이 제작했습니다.
TL;DR
이 모델은 MiniMax H3의 fl2va와 ref2va를 결합한 weight-selection merge로, fl2va를 전체 기반으로 유지하면서 후반 Transformer 블록의 adaln_proj만 ref2va에서 가져옵니다. fl2va는 높은 영상·음성 품질을, ref2va는 이미지·영상·음성 참조 조건을 제공하므로 두 checkpoint의 차이가 집중된 AdaLN 경로를 겨냥해 절충점을 만들었습니다. 두 모델의 대부분 가중치는 cosine similarity ≥ 0.9997로 같거나 매우 유사하며, 추가 학습 없이 tensor를 선택해 제작했습니다. b30-49는 품질 우선, b20-49는 참조 충실도 우선 선택지이며, 제작자는 b25-49를 첫 시도용으로 권장합니다.
핵심 포인트
- fl2va의 시청각 품질과 ref2va의 참조 조건 경로를 결합한 merge 모델입니다.
- 50개 Transformer 블록 중 지정한 후반부의 adaln_proj만 ref2va 가중치로 교체합니다.
- b30-49부터 b15-49까지 참조 충실도와 시청각 품질 사이의 선택지를 제공합니다.
- 추가 학습 없이 두 공식 checkpoint의 tensor를 선택해 self-contained checkpoint로 저장했습니다.
제한사항
- 실험적 merge라서 prompt, 참조 입력 유형, 생성 설정에 따라 결과가 달라질 수 있습니다. 블록 경계는 경험적 비교로 정해졌으며 모든 조건에서 검증된 방법은 아닙니다. 따라서 특정 variant가 항상 더 우수하다고 볼 수 없습니다.
- 비참조 생성에서는 fl2va보다 품질이 높아질 것으로 기대되지 않습니다. 모델의 대부분 가중치가 fl2va와 같고 merge의 목적이 ref2va의 참조 조건 성능 보완에 있기 때문입니다. 참조 충실도를 높일수록 원본 시청각 품질이 일부 낮아지는 절충이 남습니다.
- 원본 MiniMax H3 fl2va와 ref2va의 license 및 사용 제한을 그대로 상속합니다. 이 merge가 원본 checkpoint보다 넓은 권리를 부여하지는 않습니다. 실제 사용 전 MiniMax의 원본 모델 license를 확인해야 합니다.
127
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.