본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

debpalash/VoiceStudio

Python0 / 0

오프라인에서 음성 복제·설계·전사·더빙을 제공하는 데스크톱 스튜디오

TL;DR

VoiceStudio는 데스크톱에서 로컬로 실행되는 종합 음성 스튜디오로, Tauri 기반 UI가 번들된 Python/FastAPI 백엔드를 통해 음성 클로닝·설계·더빙·전사 기능을 제공합니다. 14개의 TTS 엔진과 11개의 ASR 엔진을 엔진 라우팅과 GPU 사전검사로 관리하며 OpenAI-호환 API로 기존 스크립트·에이전트와 한 줄 통합이 가능합니다. 개인정보 보호와 무제한 로컬 처리, 그리고 AGPL-3.0 라이선스 조건이 중요한 프로젝트에 적합하지만, 고품질 실사용은 적절한 GPU·메모리와 일부 무거운 모델(예: MOSS-TTS-v1.5 8B ~16GB)을 설치할 준비가 필요합니다.

핵심 포인트

  • VoiceStudio는 독립 실행형 데스크톱 애플리케이션으로, Tauri(Rust) 셸이 React 프런트엔드와 번들된 Python/FastAPI 백엔드를 로컬에서 실행하는 구조를 취합니다. 로컬 사이드카가 localhost:3900에서 100개 이상 REST 엔드포인트와 WebSocket/SSE 스트리밍을 제공하고, OpenAI-호환 API 표면을 통해 기존 스크립트와 에이전트에 한 줄로 통합할 수 있습니다. 이 구조 덕분에 오디오가 클라우드로 전송되지 않고 개인 하드웨어에서 모든 처리가 이루어지므로 개인정보 보호와 무제한 사용 사례에 적합합니다.
  • 기능 면에서는 제로샷 음성 클로닝(3초 샘플), 음성 설계(성별·나이·억양·감정 조절), 영상 더빙(전사→번역→재음성화→MP4) 같은 파이프라인을 한곳에서 제공합니다. 내부적으로 14개의 TTS 엔진과 11개의 ASR 엔진을 엔진 라우팅·GPU 사전검사와 함께 관리하며, MOSS-TTS-v1.5(8B, 약 16GB)와 dots.tts(2B, 약 9GB)처럼 용량이 큰 옵트인 엔진도 선택적으로 설치해 쓸 수 있습니다. 엔진을 50줄 내외의 코드로 확장 가능한 TTSBackend 서브클래싱으로 추가할 수 있어서 연구용/프로덕션용으로 유연하게 조정할 수 있습니다.
  • 시스템 요구와 성능 트레이드오프가 분명하게 문서화되어 있어 하드웨어 제약에 따른 동작을 예측할 수 있습니다. 최소 8GB RAM·4GB VRAM을 권장하며 8GB VRAM 이하에서는 TTS를 CPU로 오프로드해 동작하고, 권장 사양은 16GB RAM·8GB+ VRAM입니다; Intel macOS는 로컬 백엔드 미지원이라는 중요한 예외가 있습니다. Colab 노트북으로도 전체 스택을 부트해 기능을 체험할 수 있으므로 로컬 GPU가 없을 때 사전 검증용으로 활용 가능하다는 이점이 있습니다.
  • 개발자 통합 측면에서는 OpenAI-호환 API로 기존 ElevenLabs/OpenAI 호출을 로컬로 바꾸기만 하면 동작하며, MCP 서버로 Claude·Cursor 같은 에이전트에서 로컬 TTS/STT를 호출할 수 있습니다. Docker 배포, 원격 백엔드(토큰·PIN·OMNIVOICE_TRUSTED_NETWORKS 설정) 지원, 진단·자체 점검·스크럽드 디버그 번들 기능이 있어 운영 환경에 맞춰 배치와 문제 대응이 용이합니다. 라이선스는 AGPL-3.0이며 네트워크로 수정된 버전을 제공하면 소스 공개 의무가 발생하므로 상업적 배포 시 라이선스 조건을 반드시 검토해야 합니다.

이미지 분석

앱 런치패드 화면 스크린샷: 메인 타이틀과 기능 카드(Voice Clone, Voice Design, Video Dubbing 등)가 보임.
런치패드 UI는 제품의 주요 워크플로(클론·설계·더빙)를 카드 형태로 제시하며 646개 언어, 로컬 실행을 강조하는 배너 문구가 상단에 배치되어 있습니다. 화면 하단과 우측에 로그·버전(v0.3.9)·로컬 상태 아이콘이 보여 데스크톱 번들(Installer) 기반이고 내부 상태·진단이 UI에 노출된 설계임을 알 수 있습니다. 이 스크린샷은 사용자가 설치 후 즉시 주요 기능을 탐색할 수 있도록 설계된 온-프레미스 제품임을 시각적으로 확인시켜 줍니다.
Studio 작업화면 스크린샷: 스크립트 입력, 오디오 드롭 영역, 'Synthesize Audio' 버튼과 히스토리 패널이 보임.
Studio 탭은 음성 합성의 입력-프로세스-출력 플로우를 한 화면에서 처리하도록 배치되어 있어, 오디오 업로드 또는 녹음→스타일·스크립트 입력→Synthesize 버튼으로 결과를 생성하는 절차가 명확히 드러납니다. 우측 패널의 Voice Clones와 History 항목은 클론 프로필을 재사용하고 생성 기록을 재생해 품질을 비교하는 실무 워크플로를 지원한다는 점을 보여줍니다. 이 화면으로 실제 더빙·클로닝 작업의 운영 편의성과 반복 실험이 용이하다는 실무적 근거를 얻을 수 있습니다.
Voice Design 화면 스크린샷: 'The Librarian', 'The Anchor' 등 미리 만든 음성 디자인 카드가 나열되어 있음.
Voice Design 섹션은 미리 정의된 음성 아키타입을 카드로 제공하여 즉시 미리듣기(Preview)와 'Use this design' 선택이 가능함을 보여줍니다. 각 카드에 연령·음역·톤 같은 메타데이터가 표기되어 있어 원하는 페르소나를 빠르게 골라 프로젝트 전반에 재사용할 수 있는 구조입니다. 이런 갤러리 기반 접근은 음성 제작 반복 실험을 단축하고 비개발자도 빠르게 품질을 비교해 적용할 수 있게 해줍니다.
OmniVoice Gallery 그리드 스크린샷: 다양한 국가 깃발과 'Preview'·'Use voice' 버튼이 있는 다수의 음성 카드가 보임.
Gallery는 다국어·다음성 유형 필터와 함께 여러 음성 아티팩트를 한눈에 탐색하게 구성되어 있어 대규모 음성 라이브러리 관리처럼 동작합니다. 카드는 국기 아이콘으로 지역성을 표시하고, Preview/Use voice 버튼으로 즉시 실험 및 적용이 가능해 프로덕션 워크플로에 곧바로 연결하기 쉬운 모습을 보여줍니다. 이 화면은 600여 언어급 TTS 지원과 다양한 아키타입을 실무에서 빠르게 테스트·배포하려는 사용 사례에 맞춘 UI 설계를 뒷받침합니다.

9.8k

Stars

1.6k

Forks

+205

Trending

0

조회수

9.8k watchers2 open issuesGNU Affero General Public License v3.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.