larryvrh/MiniMax-H3-Turbo-Lora
MiniMax-H3 기반 LoRA로 4스텝에 동기화된 스테레오 오디오와 비디오를 생성
학습 방식 · 학습 방식은 MiniMax-H3 베이스에 적용되는 LoRA(저순위 업데이트)이며, 훈련 중 여러 체크포인트와 EMA 변형을 남겼습니다. 로라 수식은 W_eff = W + lora_B @ lora_A이며 alpha를 rank로 둬 추가 스케일링을 하지 않는 점이 명시되어 있습니다. 현재 최종 체크포인트인 ckpt850 기준으로 4스텝에서 높은 선명도를 얻는 지점까지 진행했으나 아티팩트 문제로 해당 라운드의 훈련은 일시 중지된 상태입니다.
TL;DR
MiniMax-H3를 베이스로 한 LoRA로서 전용 ComfyUI 노드와 샘플러를 통해 4스텝에서 비디오와 동기화된 스테레오 오디오를 생성하도록 최적화되어 있으며, 통상 약 20스텝 대비 약 5배 정도의 샘플링 시간 단축을 목표로 하고 있습니다. 가중치는 bf16 약 744MB 규모로 여러 체크포인트(최종 ckpt850 포함)와 EMA/non-EMA 변형이 제공되고, 적용 방식은 W_eff = W + lora_B @ lora_A 형태로 동작합니다. 현재 ckpt850 EMA가 권장 파일이고 4스텝에서 선명도가 높지만 플라스틱 피부·과도한 그레인 같은 알려진 아티팩트가 있어 훈련이 일시 중지된 프리뷰 상태이며, low_vram 병합·LoRA 강도·스텝 수로 품질·메모리 트레이드오프를 조정해야 합니다.
핵심 포인트
- 이 LoRA는 MiniMax-H3를 기반으로 4스텝 샘플링에서 동기화된 비디오와 스테레오 오디오를 생성하도록 최적화되어 있으며, 통상 약 20스텝 대비 약 5배 정도의 샘플링 월클럭 속도 향상을 목표로 설계되어 있습니다. 구현은 샘플러를 'MiniMax-H3 Turbo Sampler (4-step)'와 같이 대체하고 LoRA를 모델 로더와 샘플러 사이에 적용하는 방식으로 동작합니다. 다만 4스텝 설정에서는 선명도는 높지만 플라스틱 같은 피부 표현과 과도한 그레인/노이즈 같은 알려진 아티팩트가 발생할 수 있으므로 사용자가 LoRA 강도를 조정해야 합니다.
- 호환성 측면에서 이 LoRA는 MiniMax-H3의 정규(full bf16·int8_convrot) 버전뿐만 아니라 pruned_int8·pruned_fp8 같은 경량화·양자화된 베이스에도 동작하도록 설계되어 있으며, ComfyUI 노드는 pruned 베이스를 자동 감지해 시간-컨디셔닝을 런타임에 재주입합니다. low_vram 스위치를 켜면 LoRA를 베이스에 병합하여 피크 VRAM을 낮출 수 있으나 양자화된 베이스에서는 출력이 더 부드러워지는 품질 저하가 발생합니다. 따라서 메모리 여건과 원하는 선명도에 따라 low_vram 온·오프와 LoRA strength를 함께 조정해야 합니다.
- 가중치 파일은 bf16 포맷 기준으로 약 744MB 크기이며, 여러 체크포인트(초기 ~200, 중간 ~500, 최종 ~850)에 EMA·non-EMA 변형이 제공됩니다. LoRA 적용은 표준 저순위 업데이트 형태로 W_eff = W + lora_B @ lora_A 방식을 사용하고 alpha는 rank로 설정되어 추가 스케일링이 없도록 구성되어 있습니다. 개발 측은 ckpt850 EMA 파일을 '현재 최종 체크포인트'로 권장하고 있으며, 더 날카로운 non-EMA 파일도 비교 분석용으로 제공됩니다.
- Standalone 실행용 generate.py를 통해 ComfyUI 체크아웃과 베이스 모델·VAE·text-encoder 파일을 함께 로드하면 그래프 없이도 MP4 결과물을 출력할 수 있으며, 예시 커맨드라인과 필요 파일 목록이 README에 포함되어 있습니다. 출력 해상도·프레임 수 제약과 24fps 기준 프레임 그리드(예: 124 프레임 ≈ 5초)가 검증되었고, 모델 전체 크기가 크므로 높은 해상도에서 80GB GPU를 권장하나 ComfyUI 노드의 스트리밍/low_vram 옵션으로 더 작은 GPU에서도 동작 가능하다는 점이 명시되어 있습니다. 오디오는 32 kHz 스테레오로 비디오와 정렬되며 오디오·비디오가 별도 플로우 스케줄을 타는 구조이므로 전용 샘플러 사용이 필수입니다.
제한사항
- 현재 배포는 '프리뷰' 상태로 플라스틱 같은 피부 표현과 과도한 그레인/노이즈 같은 명확한 아티팩트가 보고되고 있으며, 저자도 이 문제를 해결하기 위해 훈련을 일시 중지해 추가 수정을 진행 중입니다. 따라서 실무 파이프라인에 바로 적용할 경우 품질 검증과 파라미터(LoRA strength·스텝수) 튜닝을 병행해야 합니다. 최종 안정화가 이루어질 때까지는 실험적 사용을 권장합니다.
- ComfyUI 노드와 샘플러가 프로토타입 코드 형태로 제공되어 기능과 호환성이 보장되지 않으며, 노드 리포에 이슈를 등록해 문제를 추적하도록 안내되어 있습니다. 노드는 활발히 발전 중이므로 반드시 최신 버전으로 업데이트해야 하고, 예기치 않은 호환성 문제가 발생할 수 있습니다. standalone 스크립트 사용 시에도 특정 ComfyUI 커밋에 맞춰 체크아웃을 요구하는 등 환경 고정이 필요합니다.
- 메모리 요구량이 상당하며 베이스 모델 자체가 대규모(~33B)라서 고해상도·장시간 출력에서는 대용량 GPU가 권장됩니다. low_vram 모드는 런타임에서 LoRA를 베이스에 병합해 피크 VRAM을 낮추지만 pruned·int8·fp8 같은 양자화 베이스에서 결과가 더 부드러워지는 품질 저하를 초래합니다. 또한 기본 샘플러를 그대로 쓰면 4스텝에서 오디오가 과도하게 진행되어 깨질 수 있으므로 전용 MiniMax-H3 Turbo 샘플러 사용이 필수입니다.
286
Likes
0
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.