영상과 소리를 한 번에! 립싱크까지 완벽한 오픈소스 비디오-오디오 통합 모델
비디오 및 오디오 동시 생성 (Image/Text-to-Video-Audio)32B (18B Active)apache-2.0
이미지와 텍스트를 입력받아 고품질 비디오와 동기화된 오디오를 동시에 생성하는 MoE 기반 멀티모달 모델입니다.
핵심 역량
- 비디오 및 오디오 동시 합성 (Native Bimodal)
- 정밀한 다국어 립싱크 및 구강 구조 동기화
- 환경 인지 기반 사운드 효과 (Sound FX) 생성
- MoE 구조 적용 (총 32B, 추론 시 18B 활성화)
- 이미지 및 텍스트 기반 비디오-오디오 생성 (IT2VA/T2VA)
알아두면 좋은 것
- 총 32B 파라미터 중 18B만 사용하는 효율적인 Mixture-of-Experts 설계
- 비대칭 듀얼 타워 아키텍처와 양방향 크로스 어텐션으로 모달리티 간 상호작용 강화
- Sora 2 등 폐쇄형 모델에 대응하는 가중치 및 학습 파이프라인 완전 공개
- Apache-2.0 라이선스로 상업적 활용 및 커뮤니티 기여 가능
200
Likes
22.7k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.