Viggle/Viggle-Animate
구동 영상과 다시 칠한 기준 프레임을 바탕으로 캐릭터를 교체하는 video-to-video 생성33.1Bminimax-h3-community-license
칠한 한 프레임을 기준으로 포즈를 유지한 채 영상 속 캐릭터를 교체합니다.
학습 방식 · MiniMaxAI/MiniMax-H3의 `ref2va` Transformer를 캐릭터 교체 목적에 맞게 full fine-tuning하고, 해당 fine-tuned Transformer에 rank 128 DMD2-distilled LoRA를 적용해 샘플러를 세 번의 forward pass로 축소했습니다.
TL;DR
Viggle-Animate는 MiniMaxAI/MiniMax-H3의 `ref2va` Transformer를 캐릭터 교체 목적에 맞게 full fine-tuning한 뒤 DMD2-distilled LoRA를 결합한 video-to-video 모델입니다. 구동 영상과 같은 영상에서 캐릭터를 다시 칠한 단 한 장의 프레임을 입력으로 받아, 포즈·카메라·조명·배경은 구동 영상에서 유지하고 외형만 전체 장면으로 전파합니다. 포즈 추정기·분할기·얼굴 추적기·text encoder 없이 세 번의 forward pass로 영상을 생성하므로 124프레임 렌더링을 단일 B200에서 26초에 처리합니다. 빠른 동작과 비인간 캐릭터 교체에 적합하지만, 입 모양 동기화와 다중 인물·복잡한 상호작용에서는 품질이 떨어집니다.
핵심 포인트
- 구동 영상과 그 영상에서 다시 칠한 한 프레임만 사용해 별도 포즈·마스크 추출 단계를 없앴습니다.
- MiniMax-H3의 `ref2va` Transformer를 full fine-tuning하고 DMD2-distilled LoRA로 샘플링을 세 번의 forward pass로 줄였습니다.
- 새 캐릭터의 외형은 칠한 프레임에서, 움직임과 장면 기하는 구동 영상에서 가져와 빠른 동작도 프레임 단위로 따라갑니다.
- 사람 형태를 전제로 한 표현이 없어 동물·로봇·비행기·스타일화 캐릭터까지 칠한 형태를 영상에 전파합니다.
제한사항
- 칠한 프레임에 없는 외형은 추가하지 않으며, 칠한 형태와 구동 포즈가 충돌하면 구동 영상의 형태를 따릅니다.
- 근접 촬영에서 입 모양과 음성의 동기화가 약하고, 발화에 따른 입 모양 추적이 늦습니다.
- 다중 인물·인물 간 근접 상호작용·장면 전환이 포함된 복잡한 영상에서는 품질이 떨어집니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Viggle-Animate 렌더링 시간 | 124프레임 렌더링 시간 | 26 s | 단일 B200, 480×832, 24 fps, bf16 조건; Wan2.2-Animate-14B는 160 s |
| Wan2.2-Animate-14B 대비 렌더링 속도 | 배속 | 6.1× | 동일한 소스 영상·출력 해상도·프레임 수 조건의 클립 단위 비교 |
| 샘플링 시간 비교 | 배속 | 10.3× | Viggle-Animate 13.6 s, Wan2.2-Animate-14B 140 s; Wan의 전처리 시간은 제외 |
| Viggle-Animate 추론 | forward passes | 3 | `--steps 4`가 네 개의 sigma 경계를 지정해 세 번의 pass로 실행 |
| Viggle-Animate 메모리 요구량 | bf16 Transformer 상주 메모리 | 62 GiB | 480×832·124프레임 렌더링 피크는 80.1 GiB allocated이며 96 GB 이상 GPU 또는 CPU offload가 필요 |
75
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.