Meituan이 공개한 오디오 기반 아바타 영상 생성 모델, LongCat-Video-Avatar-1.5
오디오 및 텍스트 기반 아바타 영상 생성, 오디오 기반 영상 연속 생성mit
오디오와 텍스트 입력을 통해 아바타의 움직임을 생성하는 Diffusers 기반 영상 생성 모델.
핵심 역량
- 오디오 기반 아바타 영상 생성
- 텍스트 프롬프트 기반 영상 제어
- 오디오 기반 영상 연속 생성
훈련 방식
Diffusers 기반 오디오-텍스트-비디오 생성 학습
알아두면 좋은 것
- Diffusers 프레임워크 호환
- ONNX 및 Safetensors 형식 제공
- 영어 및 중국어 데이터셋 학습
- MIT 라이선스 적용
535
Likes
2k
Downloads
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.