본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Viggle/Viggle-Animate

구동 영상과 다시 칠한 기준 프레임을 바탕으로 캐릭터를 교체하는 video-to-video 생성33.1Bminimax-h3-community-license

칠한 한 프레임을 기준으로 포즈를 유지한 채 영상 속 캐릭터를 교체합니다.

학습 방식 · MiniMaxAI/MiniMax-H3의 `ref2va` Transformer를 캐릭터 교체 목적에 맞게 full fine-tuning하고, 해당 fine-tuned Transformer에 rank 128 DMD2-distilled LoRA를 적용해 샘플러를 세 번의 forward pass로 축소했습니다.

TL;DR

Viggle-Animate는 MiniMaxAI/MiniMax-H3의 `ref2va` Transformer를 캐릭터 교체 목적에 맞게 full fine-tuning한 뒤 DMD2-distilled LoRA를 결합한 video-to-video 모델입니다. 구동 영상과 같은 영상에서 캐릭터를 다시 칠한 단 한 장의 프레임을 입력으로 받아, 포즈·카메라·조명·배경은 구동 영상에서 유지하고 외형만 전체 장면으로 전파합니다. 포즈 추정기·분할기·얼굴 추적기·text encoder 없이 세 번의 forward pass로 영상을 생성하므로 124프레임 렌더링을 단일 B200에서 26초에 처리합니다. 빠른 동작과 비인간 캐릭터 교체에 적합하지만, 입 모양 동기화와 다중 인물·복잡한 상호작용에서는 품질이 떨어집니다.

핵심 포인트

  • 구동 영상과 그 영상에서 다시 칠한 한 프레임만 사용해 별도 포즈·마스크 추출 단계를 없앴습니다.
  • MiniMax-H3의 `ref2va` Transformer를 full fine-tuning하고 DMD2-distilled LoRA로 샘플링을 세 번의 forward pass로 줄였습니다.
  • 새 캐릭터의 외형은 칠한 프레임에서, 움직임과 장면 기하는 구동 영상에서 가져와 빠른 동작도 프레임 단위로 따라갑니다.
  • 사람 형태를 전제로 한 표현이 없어 동물·로봇·비행기·스타일화 캐릭터까지 칠한 형태를 영상에 전파합니다.

제한사항

  • 칠한 프레임에 없는 외형은 추가하지 않으며, 칠한 형태와 구동 포즈가 충돌하면 구동 영상의 형태를 따릅니다.
  • 근접 촬영에서 입 모양과 음성의 동기화가 약하고, 발화에 따른 입 모양 추적이 늦습니다.
  • 다중 인물·인물 간 근접 상호작용·장면 전환이 포함된 복잡한 영상에서는 품질이 떨어집니다.

벤치마크

벤치마크지표비교
Viggle-Animate 렌더링 시간124프레임 렌더링 시간26 s단일 B200, 480×832, 24 fps, bf16 조건; Wan2.2-Animate-14B는 160 s
Wan2.2-Animate-14B 대비 렌더링 속도배속6.1×동일한 소스 영상·출력 해상도·프레임 수 조건의 클립 단위 비교
샘플링 시간 비교배속10.3×Viggle-Animate 13.6 s, Wan2.2-Animate-14B 140 s; Wan의 전처리 시간은 제외
Viggle-Animate 추론forward passes3`--steps 4`가 네 개의 sigma 경계를 지정해 세 번의 pass로 실행
Viggle-Animate 메모리 요구량bf16 Transformer 상주 메모리62 GiB480×832·124프레임 렌더링 피크는 80.1 GiB allocated이며 96 GB 이상 GPU 또는 CPU offload가 필요

75

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.