본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Wan-AI/Wan2.2-Animate-2-14B

참조 이미지와 구동 영상을 바탕으로 캐릭터 애니메이션 영상을 생성하는 Diffusion Transformer 모델14Bapache-2.0

참조 이미지의 캐릭터를 구동 영상의 움직임과 텍스트 지정 관점으로 영상화하는 14B Base 모델

학습 방식 · Wan-Animate-2는 구동 영상을 직접 입력하는 end-to-end character animation 프레임워크로, redesigned Diffusion Transformer와 Time-Align RoPE 및 Sparse-Ref Attention을 사용해 참조 이미지·구동 영상·텍스트 조건을 결합합니다.

TL;DR

Wan-AI/Wan2.2-Animate-2-14B는 별도의 motion extractor 없이 구동 영상을 직접 처리하는 14B Base character animation 모델입니다. 참조 이미지의 캐릭터 identity와 구동 영상의 움직임을 redesigned Diffusion Transformer에서 결합하고, 텍스트 prompt로 구동 영상과 분리된 camera viewpoint를 제어합니다. Time-Align RoPE와 Sparse-Ref Attention을 사용하며 VAE Encoder와 DiT 블록을 거쳐 영상을 생성합니다. 공식 기본 설정은 8× A800에서 720P를 지원하고, 480P는 2× A800에서 테스트됐습니다.

핵심 포인트

  • Wan-Animate-2는 별도의 중간 motion extractor 없이 구동 영상을 직접 처리하는 14B Base 모델입니다. 입력된 참조 이미지와 구동 영상은 VAE Encoder를 거쳐 DiT 블록에서 함께 처리됩니다. 이 구조는 모션 생성과 캐릭터 identity 보존을 하나의 end-to-end 흐름으로 수행합니다.
  • 텍스트 prompt로 구동 영상과 독립적인 카메라 viewpoint를 지정할 수 있습니다. 모델은 참조 이미지의 캐릭터 외형과 구동 영상의 움직임을 결합한 뒤 텍스트 조건에 맞춰 출력 관점을 조정합니다. 따라서 구동 영상의 촬영 시점에 출력 시점이 고정되는 문제를 줄이는 용도로 설계됐습니다.
  • 모델은 Wan-Animate-2 Base와 Distillation 가중치를 별도로 제공합니다. Distillation 버전은 classifier-free guidance 없이 10 inference steps와 Euler scheduler를 사용하도록 구성됐습니다. 이 저장소의 14B 모델은 품질 중심 Base 버전이며, 실시간 스트리밍 지연을 목표로 한 효율형 변형은 Wan-Animate-2-Lite입니다.
  • Diffusers, DiffSynth-Studio, ComfyUI 통합을 지원해 동일한 모델을 여러 추론 환경에서 사용할 수 있습니다. 공식 예시는 Base 버전에 40 inference steps를 적용하고 720P 생성을 8× A800에서 실행합니다. 480P 생성은 2× A800에서도 테스트됐지만 하드웨어에 따라 YAML 병렬 설정을 조정해야 합니다.

제한사항

  • 공식 기본 설정은 8× A800 GPU에서 720P 영상 생성을 지원하도록 조정됐습니다. 480P는 2× A800에서 테스트됐으며, 다른 하드웨어에서는 YAML 파일의 병렬 설정을 변경해야 합니다. 따라서 단일 GPU나 저사양 환경의 요구 메모리와 실행 시간은 README에서 확인되지 않았습니다.
  • Base 버전의 공식 예시는 40 inference steps를 사용하며, 별도의 Distillation 가중치가 10 steps 설정을 제공합니다. Distillation 버전은 guidance_scale 1.0으로 classifier-free guidance를 사용하지 않습니다. 두 버전의 품질·지연시간 비교 수치는 README에 공개되지 않았습니다.

이미지 분석

참조 이미지와 구동 영상을 VAE Encoder와 DiT 블록에 입력해 캐릭터 애니메이션 영상을 생성하는 Wan-Animate-2의 구조도입니다.
왼쪽 파이프라인은 Target Video, Reference Image, Reference Video를 각각 입력받아 VAE Encoder와 DiT 블록을 거친 뒤 VAE Decoder에서 출력 영상을 복원하는 흐름을 나타냅니다. 오른쪽 도식은 시공간 토큰 정렬을 위한 Time-Align RoPE와 참조 토큰에 선택적으로 attention을 수행하는 Sparse-Ref Attention의 구조를 구분해 나타냅니다. 이 설계는 참조 이미지·참조 영상 토큰과 denoising video token을 DiT 내부에서 함께 처리하는 방식과 연결됩니다.

100

Likes

0

Downloads

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.