1,000만 시간 학습으로 구현한 인간 수준의 다국어 음성 합성
AI Tool·Python0 / 0
50개 이상의 언어를 지원하며 자연어 태그로 감정과 억양을 세밀하게 제어하는 SOTA 오픈소스 음성 합성 시스템이다.
주요 기능
- 자연어 태그를 삽입하여 음성의 감정, 억양, 스타일을 단어 수준에서 정밀하게 제어한다.
- 10~30초의 짧은 음성 샘플만으로 화자의 음색과 특징을 복제하는 제로샷 보이스 클로닝을 수행한다.
- SGLang 서버를 활용해 H200 GPU 기준 0.195의 RTF와 100ms 미만의 첫 오디오 생성 시간을 달성한다.
- 단일 컨텍스트 내에서 여러 화자의 토큰을 관리하여 자연스러운 다인 대화 음성을 생성한다.
사용 사례
- 감정 표현이 중요한 오디오북 제작 및 게임 캐릭터의 대사 생성
- 다국어 지원이 필요한 글로벌 서비스의 실시간 음성 안내 시스템
- 개인화된 AI 어시스턴트 및 가상 아바타의 맞춤형 목소리 구현
26.3k
Stars
2.2k
Forks
+618
Trending
0
조회수
26.3k watchers34 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.