Abiray/MiniMax-H3-GGUF
이미지·텍스트 입력을 받아 4–15초 길이의 스테레오 오디오 포함 비디오를 생성하는 multimodal 생성minimax-h3-community-license-agreement
GGUF로 양자화된 MiniMax H3의 UNet·텍스트 인코더·VAE 패키지로 이미지·텍스트 기반 4–15초 멀티모달 비디오 생성에 적합
TL;DR
이 모델 패키지는 MiniMaxAI/MiniMax-H3를 기반으로 GGUF 형식으로 양자화된 UNet(FL2VA·Ref2VA), 텍스트 인코더, 오디오·비디오 VAE 파일을 모아 둔 배포물이며, 다양한 Q3~Q8 양자화 옵션과 파일 크기 선택지를 제공하여 사용자가 용량과 성능 트레이드오프를 선택할 수 있도록 구성되어 있습니다. 입력은 텍스트 단독 또는 이미지·비디오·오디오 혼합 참조를 받아 FL2VA는 0~2장 이미지 기반 모드, Ref2VA는 최대 9장 이미지·최대 3개 비디오 클립(각 2–15초, 총 ≤15초)·오디오 최대 3클립을 허용하면서 전체 파일 수를 12개로 제한합니다. 출력은 4–15초 길이의 비디오로 24 FPS와 32 kHz 스테레오 오디오를 생성하며 기본 짧은 쪽 768픽셀, 2K 재생성 옵션을 별도로 제공하고 있어 멀티모달 동영상 생성 파이프라인용 구성 요소 세트를 빠르게 가져다 쓸 수 있습니다.
핵심 포인트
- 이 저장소는 MiniMaxAI/MiniMax-H3를 기반으로 GGUF 양자화된 실행용 컴포넌트를 모아 둔 배포물이며, FL2VA(First-and-last-frame)와 Ref2VA(Omni-reference) 두 가지 UNet 변형의 복수 양자화 파일을 포함하고 있습니다. 제공되는 UNet 파일은 Q3에서 Q8까지 다양한 양자화 옵션을 갖추고 있으며 파일 크기는 15.6 GB에서 36 GB 범위로 기재되어 있습니다. 또한 텍스트 인코더와 오디오·비디오용 VAE 파일도 함께 포함되어 있어 모델 구성에 필요한 주요 구성 요소가 모두 제공됩니다.
- 입력 처리 방식은 모델 변형에 따라 다르며 FL2VA는 이미지 입력 수에 따라 텍스트-투-비디오, 첫/마지막 프레임 기반 생성 모드를 지원합니다. 구체적으로 FL2VA는 이미지 0장일 때 텍스트-투-비디오, 1장일 때 첫/마지막 프레임에서 확장하는 모드, 2장일 때 첫-마지막 프레임 기반 보간을 처리하도록 설계되어 있습니다. Ref2VA는 멀티모달 레퍼런스 입력을 허용하며 이미지 최대 9장, 비디오 최대 3개(각각 2–15초, 총합 ≤15초), 오디오는 이미지나 비디오와 함께 최대 3개까지 허용하고 전체 파일 수는 최대 12개로 제한되어 있습니다.
- 출력 사양은 실무에서 검증 가능한 구체적 수치로 정리되어 있으며 출력 길이는 4–15초, 프레임 레이트는 24 FPS, 오디오 출력은 32 kHz 스테레오로 표기되어 있습니다. 화면 비율은 21:9, 16:9, 4:3, 1:1, 3:4, 9:16 등 광범위한 비율을 지원하고 기본으로 짧은 쪽 길이를 768픽셀로 설정하며 2K 생성을 위해 H3-Regenerate-2K 옵션을 별도로 안내하고 있습니다. 또한 대화 언어는 아랍어·중국어·영어·프랑스어·독일어·이탈리아어·일본어·한국어·포르투갈어·러시아어·스페인어 등 11개 언어를 안정 지원한다고 명시되어 있습니다.
74
Likes
196.4k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.