본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

jamiepine/voicebox

TypeScript33 / 0

음성 클로닝·TTS·받아쓰기·에이전트 음성 출력을 로컬에서 전부 처리하는 오픈소스 음성 스튜디오.

TL;DR

Voicebox는 ElevenLabs(음성 출력)와 WisprFlow(음성 입력)가 각각 맡던 역할을 한 앱에 묶어 전부 로컬에서 돌리는 오픈소스 데스크톱 앱이다. 몇 초짜리 샘플로 목소리를 복제하고 Qwen3-TTS·Chatterbox·Kokoro 등 7개 TTS 엔진 중 하나로 23개 언어 음성을 생성하며, 전역 단축키로 어떤 앱의 텍스트 입력창에든 받아쓰기를 붙여넣을 수 있다. Claude Code나 Cursor 같은 MCP 지원 에이전트는 내장 MCP 서버를 통해 `voicebox.speak` 도구 호출 한 번으로 복제한 목소리로 말하고, 진행 상태는 화면에 뜨는 오버레이 필로 항상 드러난다. 음성 프로필마다 페르소나를 붙여 로컬 LLM이 그 인격으로 텍스트를 다시 쓰게 하는 기능까지 갖춰, Tauri 기반 네이티브 앱 하나로 음성 입출력 루프 전체를 사용자 기기 밖으로 데이터를 내보내지 않고 완결한다.

핵심 포인트

  • 출력을 맡던 ElevenLabs와 입력을 맡던 WisprFlow의 역할을 한 앱에서 로컬로 처리한다.
  • MCP 지원 에이전트가 `voicebox.speak` 호출 하나로 복제한 목소리로 말하게 할 수 있다.
  • 받아쓰기와 에이전트 발화가 같은 오버레이 필 UI를 공유해 진행 상태가 한곳에 드러난다.
  • 음성 프로필에 페르소나를 붙이면 내장 로컬 LLM이 그 인격으로 텍스트를 다시 써서 말한다.

벤치마크

벤치마크지표비교
Whisper Turbo속도8배Whisper Large 대비, 내장 STT 엔진 Whisper의 사양 인용
LuxTTS실시간 대비 속도150배CPU 추론 기준, 내장 TTS 엔진 LuxTTS의 사양 인용

49.1k

STARS

6k

FORKS

+211

TRENDING

33

조회수

watchers 49.1kopen issues 583MIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.