600개 이상의 언어를 지원하는 초고속 제로샷 TTS, OmniVoice
AI Tool·Python0 / 0
OmniVoice는 확산 언어 모델 아키텍처를 기반으로 600개 이상의 언어에 대해 고품질 제로샷 음성 복제 및 디자인 기능을 제공하는 오픈소스 TTS 도구입니다.
주요 기능
- 600개 이상의 언어를 지원하는 광범위한 제로샷 TTS 기능 제공
- 짧은 참조 오디오만으로 고품질 음성을 복제하는 Voice Cloning 수행
- 성별, 나이, 억양 등 텍스트 속성 지정을 통한 맞춤형 음성 디자인
- RTF 0.025 수준의 실시간 대비 40배 빠른 고속 추론 성능 구현
- 웃음, 한숨 등 비언어적 표현 및 정교한 발음 제어 기능 포함
어떻게 동작하는가
확산 언어 모델(Diffusion Language Model) 아키텍처를 사용하여 텍스트와 음성 특징 간의 관계를 학습하며, Whisper ASR을 통합해 참조 오디오의 텍스트를 자동으로 추출하고 음성 특징을 전이합니다.
1.7k
Stars
271
Forks
+604
Trending
0
조회수
1.7k watchers25 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.