본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Alissonerdx/Minimax-H3-ComfyUI

ComfyUI 기반 동영상 선명화 및 후처리apache-2.0

guide latent 정렬로 MiniMax H3 영상의 디테일을 선명하게 만드는 ComfyUI용 LoRA

학습 방식 · MiniMaxAI/MiniMax-H3의 ref2va 기반 rank-64 LoRA로, guide에는 약 0.1% 노이즈를 넣고 target에는 일반 노이즈를 적용하는 guide-latent 학습을 수행했습니다.

TL;DR

이 모델은 MiniMaxAI/MiniMax-H3의 ref2va를 기반으로 한 rank-64 LoRA로, ComfyUI에서 기존 영상의 선명도를 높이는 후처리에 맞춰졌습니다. 입력 영상은 텍스트 설명이 아니라 video VAE가 인코딩한 guide latent로 Transformer에 들어가며, guide와 target의 시간축·공간 격자를 맞춰 프레임 대응을 직접 형성합니다. 학습 중 guide에는 약 0.1%의 노이즈만 추가하고 target에는 일반적인 노이즈를 적용해, 두 영상을 함께 복원하기보다 source에서 target으로 변환하는 법을 학습합니다. 새 영상 생성에도 쓸 수 있지만, 이미 생성된 클립을 두 번째 단계에서 선명화하는 용도가 중심입니다.

핵심 포인트

  • guide latent를 target과 같은 시간축·해상도에 배치해 프레임별 대응을 직접 전달합니다.
  • 텍스트 Encoder에는 caption만 보내고 영상 정보는 Transformer의 latent 경로로 처리합니다.
  • ref2va에서 주로 학습됐으며, 생성보다 기존 클립의 두 번째 선명화 단계에 맞습니다.
  • 입력과 출력은 17k + 5 규칙의 유효 프레임 수와 동일한 해상도를 맞춰야 합니다.

제한사항

  • ref2va를 대상으로 학습됐고 fl2va는 테스트가 적어 결과 일관성이 낮을 수 있습니다.
  • guide와 target의 해상도·프레임 길이가 다르면 정렬이 깨지며, 프레임 수는 17k + 5 규칙을 따라야 합니다.
  • 제공된 workflow를 그대로 불러오려면 ComfyUI-AIToolkit-MiniMaxH3 custom node가 필요합니다.

79

LIKES

1.3k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.