본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

FunAudioLLM/PrismAudio

오디오 생성, 음악 생성, 비디오-투-오디오 변환mit

비디오 입력으로부터 오디오를 생성하거나 고품질 음악을 합성하는 멀티모달 오디오 생성 모델이다.

학습 방식 · Google T5/Gemma 기반 모델을 활용한 오디오 및 음악 생성 특화 파인튜닝

핵심 포인트

  • 비디오와 오디오 간의 정밀한 시각-청각 정렬 지원
  • MIT 라이선스를 통한 자유로운 활용 가능
  • 비디오 기반 오디오 생성 (Video2Audio)
  • 텍스트 프롬프트 기반 음악 합성

63

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.