Alissonerdx/Minimax-H3-ComfyUI
ComfyUI 기반 동영상 선명화 및 후처리apache-2.0
guide latent 정렬로 MiniMax H3 영상의 디테일을 선명하게 만드는 ComfyUI용 LoRA
학습 방식 · MiniMaxAI/MiniMax-H3의 ref2va 기반 rank-64 LoRA로, guide에는 약 0.1% 노이즈를 넣고 target에는 일반 노이즈를 적용하는 guide-latent 학습을 수행했습니다.
TL;DR
이 모델은 MiniMaxAI/MiniMax-H3의 ref2va를 기반으로 한 rank-64 LoRA로, ComfyUI에서 기존 영상의 선명도를 높이는 후처리에 맞춰졌습니다. 입력 영상은 텍스트 설명이 아니라 video VAE가 인코딩한 guide latent로 Transformer에 들어가며, guide와 target의 시간축·공간 격자를 맞춰 프레임 대응을 직접 형성합니다. 학습 중 guide에는 약 0.1%의 노이즈만 추가하고 target에는 일반적인 노이즈를 적용해, 두 영상을 함께 복원하기보다 source에서 target으로 변환하는 법을 학습합니다. 새 영상 생성에도 쓸 수 있지만, 이미 생성된 클립을 두 번째 단계에서 선명화하는 용도가 중심입니다.
핵심 포인트
- guide latent를 target과 같은 시간축·해상도에 배치해 프레임별 대응을 직접 전달합니다.
- 텍스트 Encoder에는 caption만 보내고 영상 정보는 Transformer의 latent 경로로 처리합니다.
- ref2va에서 주로 학습됐으며, 생성보다 기존 클립의 두 번째 선명화 단계에 맞습니다.
- 입력과 출력은 17k + 5 규칙의 유효 프레임 수와 동일한 해상도를 맞춰야 합니다.
제한사항
- ref2va를 대상으로 학습됐고 fl2va는 테스트가 적어 결과 일관성이 낮을 수 있습니다.
- guide와 target의 해상도·프레임 길이가 다르면 정렬이 깨지며, 프레임 수는 17k + 5 규칙을 따라야 합니다.
- 제공된 workflow를 그대로 불러오려면 ComfyUI-AIToolkit-MiniMaxH3 custom node가 필요합니다.
79
LIKES
1.3k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.