unsloth/MiniMax-H3-GGUF
MiniMax-H3 기반 GGUF 양자화 비디오·오디오 생성 모델
학습 방식 · 원저작인 MiniMax-H3의 파생물로서 이 배포판은 변환·양자화(transformer과 text encoder 양자화)와 모델 경량화(distillation) 단계가 포함된 형태로 제공됩니다. README는 H3가 distilled이며 cfg-free 동작 특성을 가지므로 실행 시 cfg-scale을 1.0으로 고정해야 한다는 작동 규약을 명시하고, denoiser 두 가지(fl2va_pruned/ref2va_pruned)와 Qwen3-VL 계열의 텍스트 인코더를 함께 배포하는 구조를 기술하고 있습니다. 또한 UD- rungs는 mixed-precision(dynamic) 조합이고 uniform rungs는 일관된 양자화 타입을 유지하도록 설계되어서 사용자가 정밀도·용량·속도 요구에 맞춰 rungs를 선택할 수 있게 구현되어 있습니다.
TL;DR
이 항목은 MiniMaxAI/MiniMax-H3의 GGUF 양자화 파생판으로, fl2va_pruned(첫·마지막 프레임 입력)와 ref2va_pruned(레퍼런스 이미지·비디오·오디오 입력)라는 두 denoiser 체크포인트를 별개로 제공하는 비디오 생성용 배포물입니다. 최대 15초·24 FPS·32 kHz 스테레오 오디오를 모델이 공동 생성하며 Qwen3-VL 계열의 양자화된 텍스트 인코더도 함께 포함되어 있어 텍스트·이미지·오디오를 통합한 multimodal 워크플로우를 지원합니다. stablediffusion.cpp, ComfyUI, Unsloth 등 GGUF 호환 런타임에서 동작하고 여러 양자화 rungs와 UD mixed-precision 빌드를 통해 용량·속도·품질 간의 선택이 가능하며 실행 시 --mode vid_gen, --cfg-scale 1.0, --backend te=cpu 같은 필수 플래그를 지켜야 합니다.
핵심 포인트
- 이 모델은 MiniMaxAI/MiniMax-H3를 기반으로 GGUF 포맷으로 양자화된 파생체이며, GGUF 양자화판을 여러 rungs(예: Q2_K, Q3_K, Q4_K, Q5_0, Q6_K, Q8_0)로 제공함을 알 수 있습니다. 제공 파일은 fl2va_pruned(첫·마지막 프레임 기반)와 ref2va_pruned(레퍼런스 입력 허용)라는 두 종류의 denoiser 체크포인트로 분리되어 있어 입력 유형에 따라 체크포인트를 선택해서 사용해야 합니다. 텍스트 인코더로 Qwen3-VL 계열의 양자화된 파일을 함께 제공하므로 텍스트·비디오 공동 생성 파이프라인이 통합된 형태로 동작합니다.
- 출력 형식은 네이티브 32 kHz 스테레오 오디오를 동반하는 최대 15초, 24 FPS 비디오 생성이며 VAE와 오디오 VAE를 함께 사용해야 완전한 출력물(one-file with audio)을 얻을 수 있습니다. README에 제시된 실행 예시는 sd-cli 기반의 vid_gen 모드로, 해상도·프레임·스텝·cfg-scale 등 파라미터를 조합해 단일 카드에서 클립을 생성하는 과정을 보여줍니다. 오디오가 모델 출력의 일부로 생성된다는 점은 후처리 오디오 삽입 방식이 아니라 비디오·오디오를 공동으로 생성하는 워크플로우를 의미합니다.
- 호환성 측면에서 GGUF 빌드라서 stablediffusion.cpp, ComfyUI, Unsloth 같은 환경에서 동작하도록 설계되어 있고, UD- 접두사가 붙은 rungs는 mixed-precision(dynamic) 빌드라는 점을 README가 분명히 밝히고 있습니다. 텍스트 인코더와 VAE는 공유 자원으로 처리되며 denoiser 전환 시 denoiser 파일만 추가로 내려받으면 된다는 운영상의 장점이 존재합니다. 또한 pre-quantized PyTorch 체크포인트는 별도 리포지토리(unsloth/MiniMax-H3-FP8)에 보관되어 있어 GGUF 이외의 배포판과도 연결됩니다.
제한사항
- 배포판은 MiniMax H3 Community License Agreement를 따르며 적용 지역(Applicable Territory)과 일부 관할구역 제외 조건을 포함하고 있으므로 사용 전 라이선스 전문을 확인해야 합니다. 이 모델은 MiniMax의 공식 제품이 아니며 MiniMax의 승인이나 보증을 포함하지 않는 Model Derivative로 분류되므로 법적·상업적 사용 범위에서 주의가 필요합니다. 양자화와 파생처리로 인해 원본과는 수치적 차이가 발생할 수 있음을 NOTICE에서 명시하고 있습니다.
- 실행 요구사항이 명확하게 존재하며 몇 개의 플래그가 필수입니다. sd-cli 예시에서는 --mode vid_gen, --cfg-scale 1.0, --backend te=cpu 세 플래그가 반드시 필요하다고 되어 있고 텍스트 인코더(약 12 GiB급)를 GPU에서 분리해 CPU 오프로딩하도록 권장하는 사용 지침이 포함되어 있어 리소스 계획을 세워야 합니다. 또한 대용량의 GGUF 파일(여러 rungs에서 6–20 GiB 범위)이 제공되므로 다운로드·저장·메모리 여건과 VAE·audio-vae 같은 추가 파일 의존성을 고려해야 합니다.
- 기능적 제한으로 입력 유형별로 체크포인트를 명확히 선택해야 하며 denoiser 종류를 잘못 선택하면 의도한 입력 방식(예: 시작·종료 프레임만 주는 fl2va와 레퍼런스 이미지/비디오/오디오를 받는 ref2va)이 동작하지 않을 가능성이 있습니다. VAEs는 이 리포지토리에 중복 포함되지 않고 Comfy-Org/MiniMax-H3에서 가져오도록 안내되어 있어 배포된 파일만으로 바로 실행되지 않는 경우가 생길 수 있습니다. 마지막으로 양자화 레벨과 mixed-precision 선택이 품질·속도·용량 간의 트레이드오프를 발생시키므로 운영 환경에서 실험이 필요합니다.
이미지 분석

84
Likes
15
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.