로컬에서 음성 복제·생성·시스템 전체를 다루는 오픈소스 스튜디오
로컬에서 실행되는 TTS/STT·음성 복제·다중엔진 편집 스튜디오로 MCP·REST API와 멀티트랙 타임라인을 제공한다.
TL;DR
Voicebox는 로컬 우선 설계의 통합 음성 스튜디오로, 음성 복제·TTS 생성·STT 전사·멀티트랙 편집과 에이전트 통합을 한 애플리케이션에서 제공한다. 여러 TTS 엔진(Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox 등)과 Whisper 기반 STT, 로컬 Qwen3 LLM을 런타임에서 공유해 클라우드 전송 없이 완전한 음성 I/O 파이프라인을 구현한다. 생성은 엔진 선택, 자동 오토청킹(100–5,000자 설정), 교차 페이드를 통해 긴 문장도 자연스럽게 처리하며, Chatterbox Turbo는 감정·비언어 태그([laugh], [sigh] 등)를 해석한다. GPU/플랫폼별 가속(MLX, CUDA, ROCm, DirectML)을 자동 구성하고 MCP 서버·REST API를 노출해 에이전트나 스크립트에서 바로 음성 출력·전사를 호출할 수 있다. 로컬 수행으로 개인정보가 앱 밖으로 나가지 않고 네이티브 성능을 목표로 설계된 반면, 모델 다운로드·GPU 설정·빌드 의존성(Rust, Python, Tauri 등)이 존재해 데스크탑 환경에 따라 초기 설정과 디바이스 호환성 관리가 필요하다. 서버 없는 완전한 로컬 워크플로가 필요하면 실용성이 높다, 단 리소스 제약 환경에서는 빌드와 모델 관리가 추가 작업을 요구한다.
주요 기능
- 로컬에서 음성 프로필을 녹음·업로드해 제로샷 복제 생성
- 여러 TTS 엔진(Qwen3-TTS, Chatterbox, LuxTTS 등)을 엔진별로 선택하여 음성 생성
- Whisper 기반 전사 및 전처리(LLM 정제)로 시스템 전역의 음성 입력을 텍스트로 자동 삽입
- 멀티트랙 타임라인 편집기에서 클립 드래그·트리밍·버전 관리 및 오디오 이펙트 적용
- MCP 서버·REST API로 에이전트·스크립트 통합 및 프로필 바인딩 제공
어떻게 동작하는가
데스크탑 UI는 Tauri(Rust) + React/TypeScript로 동작하고 백엔드는 FastAPI(Python)가 모델 추론·관리 API를 제공한다. 로컬 LLM(Qwen3 계열)과 여러 TTS/STT 엔진을 동일한 런타임/모델 캐시로 공유하며 MLX(Apple)·PyTorch(CUDA/ROCm/DirectML) 등 플랫폼별 가속 백엔드를 사용해 모델을 로컬에서 추론한다.
해결 문제
음성 입력(STT)과 출력(TTS)을 로컬에서 통합하여 개인정보 유출 없이 음성 복제·대화형 에이전트 음성 출력을 구현한다. 또한 여러 TTS 엔진과 편집 툴을 하나의 로컬 스튜디오로 결합해 워크플로를 단순화한다.
지금 주목받는 이유
로컬에서 완전한 음성 I/O 스택(복제·생성·전사·에이전트 통합)을 오픈소스로 제공해 개인정보 보호·오프라인 퍼포먼스를 중시하는 수요에서 주목받고 있다.
차별점
- 입력(Whisper 전사)과 출력(여러 TTS 엔진)을 한 앱에서 모두 처리해 ElevenLabs·WisprFlow처럼 기능이 분리된 서비스 대비 완전한 로컬 스택을 제공한다.
- 내장 MCP 서버와 REST API를 통해 MCP 지원 에이전트(Claude Code, Cursor 등)와 즉시 통합 가능하며 stdio 폴백 바이너리도 번들한다.
- 로컬 LLM(Qwen3 0.6B/1.7B/4B) 공유 캐시로 정제·퍼소나 변환을 수행해 추가 클라우드 호출 없이 텍스트 전처리·성격 반영이 가능하다.
- Tauri 기반으로 네이티브 성능을 목표로 하며 MLX/PyTorch/DirectML/ROCm 같은 플랫폼별 가속을 자동 구성한다.
사용 사례
- 에이전트 개발 루프에서 질의·응답을 복제한 음성으로 즉시 확인하면서 대화형 에이전트 음성 인터페이스를 테스트한다.
- 팟캐스트·대화형 내러티브 제작에서 다중 음성 트랙을 편집·트리밍하고 이펙트·버전 관리를 수행한다.
- 접근성 도구로 전세계 언어 전사를 로컬에서 수행해 포커스된 텍스트 필드에 자동으로 붙여넣는 전사 기반 워크플로를 구현한다.
- 게임·인터랙티브 캐릭터에 클론된 음성과 퍼소나 LLM을 결합해 실시간 대사 생성 및 재생 파이프라인을 구성한다.
시작하기
git clone https://github.com/jamiepine/voicebox.git && cd voicebox just setup # Python venv 및 의존성 설치 just dev # 백엔드와 데스크탑 앱 실행 (빌드: just build 또는 Windows용 just build-local)
요구사항
- Bun (프론트엔드 dev 도구)
- Rust (Tauri 빌드)
- Python 3.11+ (백엔드)
- Tauri 요구사항(플랫폼별) 및 Xcode(macOS에서 빌드 시)
- GPU 가속: macOS MLX, Windows/Linux CUDA, Linux ROCm, DirectML(Windows), Intel XPU 등 (CPU에서도 동작하지만 느림)
- Docker 사용 시 docker compose up으로 실행 가능
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| LuxTTS | CPU realtime factor | 150x | — |
| LuxTTS | VRAM | ~1GB | — |
| Qwen3-TTS | model sizes | 0.6B / 1.7B | — |
| TADA | model sizes | 1B / 3B | — |
| Kokoro | model size | 82M | — |
| Max generation length | max characters | 50,000 | — |
| Whisper Turbo | throughput | ~8x | vs Whisper Large |
| TADA | coherent audio length | 700s+ | — |
이미지 분석



46.3k
Stars
5.7k
Forks
+209
Trending
32
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.