화자 식별 오류율을 8.38%에서 1.20%로 낮춘 혁신적 제로샷 영화 더빙 시스템
제로샷 영화 더빙 및 멀티모달 데이터셋 구축apache-2.0
다양한 시네마틱 장면에서 고품질 음성 및 입술 동기화를 구현하는 통합 더빙 모델 및 데이터 구축 파이프라인
핵심 역량
- 제로샷 영화 더빙
- 멀티모달 화자 식별 및 다이어리제이션
- 음성 분리 및 배경음 제거
- 자동 자막 생성 및 비디오 클리핑
- Chain-of-Thought 기반 텍스트 및 화자 정보 교정
강점
- 화자 식별 오류율(DER) 8.38%에서 1.20%로 감소
- 기존 SOTA 대비 우수한 립싱크 및 음색 전이 성능
- 데이터 수집부터 추론까지 전 과정을 아우르는 통합 툴킷 제공
훈련 방식
MLLM 기반 아키텍처에 멀티모달 CoT 교정 전략을 결합하고 CineDub-CN/EN 데이터셋으로 학습 및 검증 수행
알아두면 좋은 것
- CineDub-CN 및 CineDub-EN 대규모 더빙 데이터셋 포함
- 멀티모달 CoT를 통해 CER을 4.53%에서 0.94%로 개선
- 소비자용 GPU에서 실행 가능한 추론 코드 및 스크립트 제공
- Apache 2.0 라이선스로 학술 및 연구 목적 활용 가능
49
Likes
47
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.