drbaph/MiniMax-H3-Turbo-Lora-ComfyUI
MiniMax‑H3 Turbo LoRA의 ComfyUI pruned-model 호환 partial 변환판, 4-step 초저스텝 오디오·비디오 프리뷰
학습 방식 · 원저자인 larryvrh가 four-step distillation과 dual video/audio sampling 방식을 사용해 Turbo LoRA를 학습하고 초기 프리뷰를 릴리스한 이력이 README에 기록되어 있습니다. 이 저장소의 파일들은 원저자의 훈련 결과물을 ComfyUI의 pruned/curve-form MiniMax-H3 로더에 맞게 부분 변환한 산출물로, 변환 과정에서는 텐서 네임스페이스 재매핑과 일부 AdaLN 텐서 가지치기를 수행하고 BF16 dtype과 LoRA A/B 페어·rank를 보존하는 방식이 적용되어 있습니다. 저장소 자체에서 새로 학습을 수행한 것은 아니며, ckpt500 파일들은 원저자의 초기 프리뷰에서 추가로 진행된 further-trained 체크포인트를 변환한 결과로 분류됩니다.
TL;DR
이 자료는 MiniMax-H3 Turbo LoRA를 ComfyUI의 pruned/curve-form MiniMax-H3 체크포인트용으로 부분 변환한 LoRA 모음으로, 원저자의 four-step distillation을 전제로 한 초저스텝(4-step) 오디오·비디오 생성 프리뷰를 포함합니다. 변환본은 safetensors·BF16을 유지하고 EMA/non-EMA와 further-trained ckpt500 변형을 제공하며, 원본 텐서 네임스페이스를 diffusion_model.*로 매핑해 ComfyUI 로더 호환성을 확보했습니다. 실사용 권장 설정으로는 Video sigma shift 12, Audio sigma shift 4–6, Steps 8–10 (ckpt500은 6–8), sampler로 res_multistep, 그리고 LoRA strength 0.8–1.8이 README에 제시되어 있으며 optional accelerators(SageAttention, Sol Attention, Gradient, Spectrum)가 동작 확인된 상태입니다. 주의할 점은 원저자의 릴리스가 초기 프리뷰(under-trained)임을 분명히 하고 있으므로 품질 평가 시 EMA vs non-EMA, ckpt500 전후 비교와 동일한 샘플링·시드·모델 설정을 유지해야 한다는 점입니다.
핵심 포인트
- 이 저장소는 MiniMax-H3 기반의 Turbo LoRA를 ComfyUI용으로 부분 변환한 LoRA 어댑터들을 포함하며, base_model으로 Comfy-Org/MiniMax-H3의 pruned/curve-form 체크포인트를 전제로 합니다. 변환판은 safetensors 포맷과 BF16 dtype을 유지하고 있으며 EMA와 non-EMA, 그리고 further-trained checkpoint-500 변형을 각각 제공합니다. 변환 과정에서 원본의 LoRA A/B 쌍 구조·rank·텐서 형태를 보존하되 일부 AdaLN 관련 텐서를 가지치기(prune)하여 ComfyUI 로더 호환성을 확보했습니다.
- 성능 관점에서는 원저자의 four-step distillation을 통해 통상 약 20스텝 수준의 생성 과정 대신 4 스텝으로 동영상을 생성하도록 설계되어 있고, README에서는 대략 5×의 샘플링 시간 단축을 제시합니다. 단 이 4-step Turbo는 초기 프리뷰·미완성 체크포인트로 표기되어 under-trained 특성이 존재하며, EMA와 non-EMA 간에는 시간평균 가중치의 매끄러움 차이가 보고되어 있습니다. 운영 환경에서는 샘플링 스텝과 LoRA strength를 조합해 결과 품질과 속도 사이를 조정해야 합니다.
- 파일별 차이는 명확하게 기술되어 있으며 retained/ pruned 구성 수치가 README에 포함되어 있습니다. 원본 전체 모델은 소스 텐서 518개·LoRA A/B 쌍 259개였고, pruned ComfyUI 변환본은 보유 텐서 416개·LoRA A/B 쌍 208개, 가지친 AdaLN 텐서 102개·AdaLN A/B 쌍 51개로 기록되어 있어 어떤 부분이 제거되고 보존되었는지 추적할 수 있습니다. 네임스페이스 변환도 문서화되어 있어 원본 key들(blocks.*, token_refiner.*)이 diffusion_model.* 네임스페이스로 매핑된 구현 방식을 그대로 재현할 수 있습니다.
제한사항
- 파츠 호환성 제약 때문에 이 파일들은 pruned/curve-form MiniMax-H3 체크포인트 전용의 partial ComfyUI 호환 버전으로 표기되어 있으며, 원본 full-model Turbo LoRA의 모든 텐서가 포함되어 있지 않습니다. 이로 인해 일부 원본 기능이나 시간-평균화 효과가 온전히 재현되지 않을 수 있고, 변환본과 원본 간 품질 차이가 존재할 가능성이 README에 명시되어 있습니다. ComfyUI 환경에서 사용 시에는 반드시 pruned/curve-form MiniMax-H3 체크포인트와 동일한 샘플러·시드·해상도 설정을 유지해야 비교가 의미 있습니다.
- 원저자 스스로 초기 릴리스를 under-trained·초기 EMA 미성숙 상태로 분류하고 있어 출력 품질이 완성된 학습 결과를 대체하지 못합니다. 특히 오디오 스케줄링 민감도가 높아서 잘못된 sigma shift나 스케줄러 설정은 audio가 왜곡되거나 잡음처럼 들리는 등 심각한 품질 문제로 이어질 수 있습니다. 따라서 오디오 문제 발생 시 LoRA 탓으로 단정하기보다 sampler와 scheduler, audio sigma-shift 및 워크플로우 구성을 먼저 점검해야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Sampling steps / wall-clock | wall-clock reduction | 4-step preview vs ≈20-step baseline, roughly 5× reduction | vs baseline MiniMax-H3 ~20 steps |
이미지 분석

110
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.