ElevenLabs를 대체하는 로컬 음성 복제 및 더빙 스튜디오, OmniVoice Studio
AI Tool·Python7 / 0
로컬 환경에서 음성 복제, 더빙, 실시간 받아쓰기, 화자 분리 기능을 제공하는 오픈소스 데스크톱 애플리케이션입니다.
주요 기능
- 3초 길이의 샘플로 제로샷 음성 복제 수행
- 성별, 나이, 억양, 피치 등 세부적인 음성 디자인 적용
- 유튜브 URL이나 파일을 입력받아 번역 및 더빙된 MP4 파일 생성
- 시스템 전역에서 작동하는 실시간 받아쓰기 위젯 제공
- CUDA, MPS, ROCm 환경에서 GPU 가속 자동 감지 및 오프로딩
어떻게 동작하는가
FastAPI 백엔드에서 WhisperX, Demucs, Pyannote 등 오픈소스 모델 파이프라인을 실행하고, React 기반 프론트엔드와 WebSocket으로 통신하며 로컬 GPU 자원을 활용해 음성 처리 작업을 수행합니다.
2.8k
Stars
389
Forks
+513
Trending
7
조회수
2.8k watchers22 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.