비디오 기반 오디오 생성과 음악 합성을 지원하는 PrismAudio 오픈소스 모델
오디오 생성, 음악 생성, 비디오-투-오디오 변환mit
비디오 입력으로부터 오디오를 생성하거나 고품질 음악을 합성하는 멀티모달 오디오 생성 모델이다.
핵심 역량
- 비디오 기반 오디오 생성 (Video2Audio)
- 텍스트 프롬프트 기반 음악 합성
- 고품질 오디오 샘플링
- 멀티모달 컨텍스트 이해
강점
- 비디오와 오디오 간의 정밀한 시각-청각 정렬 지원
- MIT 라이선스를 통한 자유로운 활용 가능
훈련 방식
Google T5/Gemma 기반 모델을 활용한 오디오 및 음악 생성 특화 파인튜닝
알아두면 좋은 것
- MIT 라이선스로 상업적 이용 및 수정 가능
- Google의 T5/Gemma 기반 아키텍처 활용
- Arxiv 논문(2511.18833, 2506.21448) 기반의 연구 성과 반영
63
Likes
0
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.