LBH-123-AI/Minimax_h3_latent_Upscaler
Minimax H3 영상의 24채널 VAE latent를 직접 확대해 고해상도 생성을 가속하는 neural latent-space upscaling
Minimax H3의 24채널 VAE latent를 직접 확대해 고해상도 영상 생성을 가속하는 3D convolution upscaler입니다.
학습 방식 · Minimax H3의 24채널 VAE latent를 대상으로 약 80,000개 paired sample을 학습한 3D convolution 기반 neural upscaler이며, temporal convolution과 trilinear interpolation을 결합합니다.
TL;DR
Minimax H3 전용 neural latent-space upscaler로, 24채널 VAE latent의 시간축은 유지하면서 공간 해상도를 1.0×부터 4.0×까지 확대합니다. 저해상도 영상을 먼저 생성한 뒤 latent를 3D convolution으로 처리하고 재샘플링하므로, 약 5B 파라미터 VAE를 거치는 decode·픽셀 확대·encode 왕복을 피합니다. 약 80,000개의 영상·이미지 paired sample로 학습했으며, Minimax H3 고해상도 생성 가속과 단순 latent 보간에서 생기는 ghosting 완화를 목표로 합니다.
핵심 포인트
- Minimax H3의 24채널 VAE latent에서 시간축은 유지하고 H×W 공간 해상도만 확대합니다. 영상 latent를 직접 처리하므로 픽셀로 decode한 뒤 확대하고 다시 encode하는 약 5B 파라미터 VAE 왕복을 건너뜁니다. 저해상도 생성 후 latent 확대와 재샘플링을 이어 고해상도 생성 시간을 줄이는 구조입니다.
- 3D convolution backbone과 temporal convolution을 사용해 영상 프레임 사이의 시간 정보를 처리합니다. trilinear interpolation을 결합해 1.0×부터 4.0×까지 0.1 단위의 연속적인 확대 배율을 지원합니다. 단순 bilinear·bicubic latent 보간에서 발생하는 ghosting과 이중 이미지 아티팩트 완화를 목표로 합니다.
- 약 80,000개의 저해상도 latent·고해상도 목표 paired sample로 학습했습니다. 구성은 영상 약 70,000쌍과 2K 이미지 약 8,000쌍이며, 2× 배율 데이터가 약 40%로 가장 큰 비중을 차지합니다. 1.0×부터 4.0× 사이 임의의 소수 배율 데이터도 약 10% 포함해 중간 배율 일반화를 겨냥합니다.
제한사항
- README에는 PSNR, SSIM, 처리 시간 단축률 같은 정량 벤치마크가 없습니다. 따라서 저해상도 생성 후 이 모델을 적용했을 때 실제 속도 향상 폭이나 화질 개선 정도는 공개 수치로 비교하기 어렵습니다. 제공된 비교 이미지는 시각적 사례로만 활용할 수 있습니다.
- 사용에는 companion ComfyUI custom node가 필요합니다. 체크포인트를 ComfyUI/models/latent_upscale_models/에 배치하고 MinimaxH3 메뉴의 2D 또는 3D 노드를 연결해야 합니다. 지원 대상이 Minimax H3의 latent 파이프라인으로 한정되어 다른 영상 생성 모델에 바로 적용할 수 있다는 근거는 없습니다.
이미지 분석

101
Likes
0
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.