FunAudioLLM/Fun-CineForge
제로샷 영화 더빙 및 멀티모달 데이터셋 구축apache-2.0
다양한 시네마틱 장면에서 고품질 음성 및 입술 동기화를 구현하는 통합 더빙 모델 및 데이터 구축 파이프라인
학습 방식 · MLLM 기반 아키텍처에 멀티모달 CoT 교정 전략을 결합하고 CineDub-CN/EN 데이터셋으로 학습 및 검증 수행
핵심 포인트
- 화자 식별 오류율(DER) 8.38%에서 1.20%로 감소
- 기존 SOTA 대비 우수한 립싱크 및 음색 전이 성능
- 데이터 수집부터 추론까지 전 과정을 아우르는 통합 툴킷 제공
- 제로샷 영화 더빙
49
LIKES
47
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.