본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

baidu/NAVA

텍스트 기반 오디오 및 비디오 생성5Bapache-2.0

Wan2.2-TI2V-5B 모델을 기반으로 텍스트 입력에서 오디오와 비디오를 동시에 생성하는 멀티모달 생성 모델.

학습 방식 · Wan2.2-TI2V-5B 기반 MMDiT 및 Flow Matching 학습

핵심 포인트

  • 텍스트 기반 비디오 생성
  • 텍스트 기반 오디오 생성
  • 오디오-비디오 동기화 생성

88

LIKES

263

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.