음악 전체 문맥으로 분 단위 춤 영상을 생성하는 Wan-Dancer 14B
Wan-Dancer-14B는 이미지와 음악을 조건으로 전역 키프레임 계획과 지역적 정교화를 결합해 분 단위의 일관된 춤 영상을 생성하는 diffusers 기반 모델이다.
TL;DR
Wan-Dancer-14B는 diffusers 기반으로 이미지와 전체 음악 트랙을 조건으로 분 단위의 일관된 춤 영상을 생성하는 모델이다. 핵심 설계는 전역 키프레임 계획과 지역적 시간 정교화로 생성 과정을 분해해 장기 구조와 프레임 단위 디테일을 각각 담당하게 함으로써 긴 영상에서의 리듬 일관성을 확보한다. 프로젝트는 가중치와 추론 코드를 공개하고 장르별 프롬프트와 샘플 비디오를 제공해 재현성과 실험 접근성을 높였으며 Apache-2.0 라이선스로 배포되어 상업적 사용이 가능하다. README에는 설치와 추론용 예제 스크립트, 긴 영상 생성 시 num_inference_steps 값을 늘려 품질을 제어하라는 실무 지침이 포함되어 있어 실제 적용을 위한 실용적 가이드를 제공한다. 다만 공개된 문서에는 표준화된 벤치마크 수치가 없어 성능 비교는 별도 실험으로 확인해야 한다.
핵심 역량
- 모델은 전체 음악 트랙을 문맥으로 사용해 전역 키프레임을 계획하고 그 결과를 기반으로 연속적인 비디오 시퀀스를 생성할 수 있다. 이 과정은 입력 이미지의 인물 외형과 포즈를 유지하면서 음악 박자에 맞춘 동작 전개를 반영하도록 작동한다. 프롬프트 파일로 춤 스타일을 지정하면 장르별 특성에 맞춘 모션 패턴을 반영한 비디오가 출력된다.
- 모델은 전역 단계와 지역 단계의 두 단계 워크플로를 통해 긴 시간 동안의 일관성을 확보한다. 전역 단계는 긴 범위의 타이밍과 주요 포즈를 결정하고 지역 단계는 그 사이를 높은 빈도로 보간하며 시각적 디테일을 개선한다. 이 분리된 설계는 분 단위 이상의 영상에서도 리듬과 구조를 유지하는 데 기여한다.
- 배포된 스크립트는 전역 생성과 로컬 정교화를 분리하여 재현성과 파이프라인 연동을 용이하게 만든다. gen_video_global.sh는 키프레임 기반의 전역 비디오를 생성하고 gen_video_local.sh는 해당 전역 비디오를 입력으로 받아 해상도와 프레임 디테일을 높인다. 이 구조는 사용자 실험에서 단계별 파라미터 조정을 허용한다.
- diffusers 파이프라인을 기반으로 구현되어 기존 diffusion 기반 이미지 생성 툴체인과 연동 가능하다. README의 설치 권장사항에는 flash_attn와 xfuser 같은 성능 최적화 패키지가 포함되어 있어 고성능 GPU 환경에서의 추론 최적화를 지원한다. num_inference_steps 값을 늘리는 방식으로 더 긴 시간 영상의 품질과 안정성을 관리하도록 설계되었다.
강점
- 모델은 분 단위의 장기적 일관성을 목표로 한 계층적 설계로 긴 시간 생성에서 구조와 리듬을 유지하는 데 초점을 맞추었다. 전역과 지역 단계를 분리함으로써 사용자 조정이 가능한 중간 산출물을 생성해 실험과 디버깅이 용이하다. 연구 배포와 함께 추론 코드와 체크포인트를 공개해 실무 적용 가능성이 높다.
- 공개 라이선스가 Apache-2.0으로 명시되어 있어 상업적 사용과 내부 개조가 허용되는 이점이 있다. HuggingFace와 ModelScope에 가중치와 데모 링크가 제공되어 빠른 프로토타이핑과 검증이 가능하다. 설치 안내에는 성능 최적화를 위한 라이브러리 권장이 포함되어 있어 고성능 환경에서 효율적 추론을 기대할 수 있다.
- 프롬프트 기반 장르 지정과 참조 이미지 입력을 함께 지원해 스타일 제어와 시각적 일관성 유지가 모두 가능하다. README에 장르별 예시와 샘플 비디오 링크가 제공되어 출력 특성을 빠르게 확인할 수 있다. 이러한 구성은 연구용 실험과 데모 제작 양쪽 모두에 실용적인 기반을 제공한다.
훈련 방식
모델은 전역 키프레임 계획과 지역적 시간 정교화를 분리한 계층적 프레임워크로 학습되었다. 이 설계는 전체 음악 트랙의 문맥을 활용해 장기 구조를 예측하고 그 구조를 토대로 단기적 동작을 정교화하는 방식으로 작동한다. README는 이러한 분해가 분 단위 이상의 일관성 확보에 기여한다고 기술하고 있다.
알아두면 좋은 것
- 프로젝트는 계층적 프레임워크를 핵심으로 하여 음악 전체 문맥을 반영한 전역 키프레임 계획과 지역적 시간 정교화를 분리해 분 단위의 일관된 춤 영상을 생성한다. GitHub와 HuggingFace에 모델 가중치와 추론 코드를 공개했으며 arXiv 논문 링크를 README에서 제공하고 있다. 이로 인해 연구 재현성과 실험적 검증이 비교적 용이하다.
- 공개된 파이프라인은 두 단계 워크플로로 구성되어 전역 생성 단계에서 스타일별 프롬프트와 참조 이미지를 사용해 골격 비디오를 만들고 로컬 정교화 단계에서 해상도와 프레임 연속성을 개선한다. README는 장르별 예시 프롬프트와 샘플 비디오 링크를 포함해 실제 입력 설정과 출력 예시를 명확히 제시하고 있다. num_inference_steps 값으로 긴 시간 생성 시 품질 제어가 가능하다고 안내하고 있다.
- 배포 문서에는 설치와 의존 패키지 목록이 상세히 포함되어 있으며 Hugging Face CLI와 ModelScope CLI를 통한 모델 다운로드 예시가 제공되어 있다. 설치 권장 패키지로는 torch, torchvision, diffusers, flash_attn, xfuser 등이 명시되어 있어 고성능 GPU 기반 추론을 전제로 하고 있다. 또한 ComfyUI 통합과 같은 실용적 연동도 작업 목록에 포함되어 있다.
- 모델 라이선스는 Apache-2.0으로 명시되어 있어 상업적 사용과 재배포가 가능한 조건으로 배포되어 있다. README의 Latest News에 모델 및 코드 공개 일자가 표기되어 있고 여러 데모 플랫폼 링크를 통해 데모 실행 환경에 접근할 수 있다. 다만 README 내에는 공개 벤치마크 수치가 포함되어 있지 않아 성능 비교는 별도의 실험이 필요하다.
기술적 특징
- 모델은 전역 키프레임 계획 단계와 지역적 정교화 단계를 분리한 계층적 파이프라인을 채택했다. 전역 단계는 음악의 전체 문맥을 분석해 주요 타이밍과 포즈를 배치하며 지역 단계는 그 사이를 높은 빈도로 보간해 디테일을 보강한다. 이 분리 설계는 장기 일관성과 로컬 품질을 동시에 확보하는 구조적 이점을 제공한다.
- 음악 전체 트랙을 입력으로 사용하여 전역 계획에서 장기 패턴을 반영한다. 이는 구간별 클라이맥스와 반복 구조에 맞춰 키프레임 타이밍을 결정할 수 있게 하며 결과적으로 리듬 일치가 자연스러워진다. README는 이 접근이 분 단위 생성에서 특히 중요하다고 명시하고 있다.
- 추론 파이프라인은 diffusers 기반으로 구현되어 기존 diffusion 생태계와 호환된다. README는 num_inference_steps 값을 늘리는 방식으로 긴 시간 영상의 품질을 제어하도록 권장하고 있으며 전역 단계에서는 예로 48 스텝을 제시하고 있다. 또한 flash_attn와 xfuser 같은 성능 최적화 패키지를 권장해 대규모 추론 효율을 고려했다.
- 프로젝트는 장르별 프롬프트 파일과 참조 이미지 입력을 표준화해 스타일 제어와 재현성을 확보했다. 각 장르에 대해 글로벌과 로컬 프롬프트가 따로 제공되어 사용자는 전역 구조와 국부적 표현을 별도로 조정할 수 있다. 이 구성은 다양한 댄스 장르에 대한 출력 적합성을 높이는 실용적 설계이다.
차별점
- 계층적 전역-지역 파이프라인을 명시적으로 제공해 분 단위의 장기 일관성 확보에 초점을 맞추었다. 이 구조는 전역 키프레임에서 전체 플랜을 정하고 로컬 단계에서 디테일을 보강하는 방식으로 긴 영상에서의 리듬 일치를 개선한다. 공개된 스크립트로 두 단계 워크플로를 바로 재현할 수 있다.
- 전체 음악 트랙을 문맥으로 활용해 전역 계획을 수립함으로써 음악의 장기 구조와 클라이맥스를 반영한 동작 배치를 지원한다. 이 방식은 짧은 오디오 윈도우만 사용하는 접근보다 장기적 리듬 일관성에서 우위를 갖는다. README에 데이터 전처리나 구간 처리 방식 예시가 포함되어 있어 구현 재현성이 높다.
- 모델과 추론 코드를 함께 Apache-2.0 라이선스로 배포해 상업적 사용과 수정이 용이하다. HuggingFace와 ModelScope를 통한 가중치 배포와 데모 링크 제공으로 실험 접근성이 확보되어 실무 적용이 빠르게 가능하다. 설치 안내에서 성능 패키지를 권장해 대규모 추론 환경 준비를 돕는다.
166
Likes
3.9k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.