debpalash/VoiceStudio
Python0 / 0
오프라인에서 음성 복제·설계·전사·더빙을 제공하는 데스크톱 스튜디오
TL;DR
VoiceStudio는 데스크톱에서 로컬로 실행되는 종합 음성 스튜디오로, Tauri 기반 UI가 번들된 Python/FastAPI 백엔드를 통해 음성 클로닝·설계·더빙·전사 기능을 제공합니다. 14개의 TTS 엔진과 11개의 ASR 엔진을 엔진 라우팅과 GPU 사전검사로 관리하며 OpenAI-호환 API로 기존 스크립트·에이전트와 한 줄 통합이 가능합니다. 개인정보 보호와 무제한 로컬 처리, 그리고 AGPL-3.0 라이선스 조건이 중요한 프로젝트에 적합하지만, 고품질 실사용은 적절한 GPU·메모리와 일부 무거운 모델(예: MOSS-TTS-v1.5 8B ~16GB)을 설치할 준비가 필요합니다.
핵심 포인트
- VoiceStudio는 독립 실행형 데스크톱 애플리케이션으로, Tauri(Rust) 셸이 React 프런트엔드와 번들된 Python/FastAPI 백엔드를 로컬에서 실행하는 구조를 취합니다. 로컬 사이드카가 localhost:3900에서 100개 이상 REST 엔드포인트와 WebSocket/SSE 스트리밍을 제공하고, OpenAI-호환 API 표면을 통해 기존 스크립트와 에이전트에 한 줄로 통합할 수 있습니다. 이 구조 덕분에 오디오가 클라우드로 전송되지 않고 개인 하드웨어에서 모든 처리가 이루어지므로 개인정보 보호와 무제한 사용 사례에 적합합니다.
- 기능 면에서는 제로샷 음성 클로닝(3초 샘플), 음성 설계(성별·나이·억양·감정 조절), 영상 더빙(전사→번역→재음성화→MP4) 같은 파이프라인을 한곳에서 제공합니다. 내부적으로 14개의 TTS 엔진과 11개의 ASR 엔진을 엔진 라우팅·GPU 사전검사와 함께 관리하며, MOSS-TTS-v1.5(8B, 약 16GB)와 dots.tts(2B, 약 9GB)처럼 용량이 큰 옵트인 엔진도 선택적으로 설치해 쓸 수 있습니다. 엔진을 50줄 내외의 코드로 확장 가능한 TTSBackend 서브클래싱으로 추가할 수 있어서 연구용/프로덕션용으로 유연하게 조정할 수 있습니다.
- 시스템 요구와 성능 트레이드오프가 분명하게 문서화되어 있어 하드웨어 제약에 따른 동작을 예측할 수 있습니다. 최소 8GB RAM·4GB VRAM을 권장하며 8GB VRAM 이하에서는 TTS를 CPU로 오프로드해 동작하고, 권장 사양은 16GB RAM·8GB+ VRAM입니다; Intel macOS는 로컬 백엔드 미지원이라는 중요한 예외가 있습니다. Colab 노트북으로도 전체 스택을 부트해 기능을 체험할 수 있으므로 로컬 GPU가 없을 때 사전 검증용으로 활용 가능하다는 이점이 있습니다.
- 개발자 통합 측면에서는 OpenAI-호환 API로 기존 ElevenLabs/OpenAI 호출을 로컬로 바꾸기만 하면 동작하며, MCP 서버로 Claude·Cursor 같은 에이전트에서 로컬 TTS/STT를 호출할 수 있습니다. Docker 배포, 원격 백엔드(토큰·PIN·OMNIVOICE_TRUSTED_NETWORKS 설정) 지원, 진단·자체 점검·스크럽드 디버그 번들 기능이 있어 운영 환경에 맞춰 배치와 문제 대응이 용이합니다. 라이선스는 AGPL-3.0이며 네트워크로 수정된 버전을 제공하면 소스 공개 의무가 발생하므로 상업적 배포 시 라이선스 조건을 반드시 검토해야 합니다.
이미지 분석




9.8k
Stars
1.6k
Forks
+205
Trending
0
조회수
9.8k watchers2 open issuesGNU Affero General Public License v3.0
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.