본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

OpenMOSS-Team/MOVA-360p

비디오 및 오디오 동시 생성 (Image/Text-to-Video-Audio)32B (18B Active)apache-2.0

이미지와 텍스트를 입력받아 고품질 비디오와 동기화된 오디오를 동시에 생성하는 MoE 기반 멀티모달 모델입니다.

핵심 포인트

  • 비디오 및 오디오 동시 합성 (Native Bimodal)
  • 정밀한 다국어 립싱크 및 구강 구조 동기화
  • 환경 인지 기반 사운드 효과 (Sound FX) 생성
  • MoE 구조 적용 (총 32B, 추론 시 18B 활성화)

200

LIKES

22.7k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.