jamiepine/voicebox
TypeScript33 / 0
음성 클로닝·TTS·받아쓰기·에이전트 음성 출력을 로컬에서 전부 처리하는 오픈소스 음성 스튜디오.
TL;DR
Voicebox는 ElevenLabs(음성 출력)와 WisprFlow(음성 입력)가 각각 맡던 역할을 한 앱에 묶어 전부 로컬에서 돌리는 오픈소스 데스크톱 앱이다. 몇 초짜리 샘플로 목소리를 복제하고 Qwen3-TTS·Chatterbox·Kokoro 등 7개 TTS 엔진 중 하나로 23개 언어 음성을 생성하며, 전역 단축키로 어떤 앱의 텍스트 입력창에든 받아쓰기를 붙여넣을 수 있다. Claude Code나 Cursor 같은 MCP 지원 에이전트는 내장 MCP 서버를 통해 `voicebox.speak` 도구 호출 한 번으로 복제한 목소리로 말하고, 진행 상태는 화면에 뜨는 오버레이 필로 항상 드러난다. 음성 프로필마다 페르소나를 붙여 로컬 LLM이 그 인격으로 텍스트를 다시 쓰게 하는 기능까지 갖춰, Tauri 기반 네이티브 앱 하나로 음성 입출력 루프 전체를 사용자 기기 밖으로 데이터를 내보내지 않고 완결한다.
핵심 포인트
- 출력을 맡던 ElevenLabs와 입력을 맡던 WisprFlow의 역할을 한 앱에서 로컬로 처리한다.
- MCP 지원 에이전트가 `voicebox.speak` 호출 하나로 복제한 목소리로 말하게 할 수 있다.
- 받아쓰기와 에이전트 발화가 같은 오버레이 필 UI를 공유해 진행 상태가 한곳에 드러난다.
- 음성 프로필에 페르소나를 붙이면 내장 로컬 LLM이 그 인격으로 텍스트를 다시 써서 말한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Whisper Turbo | 속도 | 8배 | Whisper Large 대비, 내장 STT 엔진 Whisper의 사양 인용 |
| LuxTTS | 실시간 대비 속도 | 150배 | CPU 추론 기준, 내장 TTS 엔진 LuxTTS의 사양 인용 |
49.1k
STARS
6k
FORKS
+211
TRENDING
33
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.