kyutai-labs/pocket-tts
Python2 / 0
Pocket TTS는 100M 파라미터 경량 모델로 CPU에서 동작하며 약 200ms의 초기 지연과 실시간 대비 6배 속도를 달성하는 오픈소스 TTS이다.
TL;DR
Pocket TTS는 GPU나 원격 API 없이 로컬 CPU에서 동작하도록 설계된 약 100M 파라미터 경량 TTS로, 스트리밍으로 약 200ms 내에 첫 오디오 청크를 반환하고 MacBook Air M4 기준으로 실시간 대비 약 6배의 처리 속도를 보고한다. 음성 클로닝은 입력 오디오에서 voice state를 추출해 safetensors로 저장한 뒤 디스크에서 kvcache를 빠르게 읽어 로딩 시간을 최소화하는 방식으로 구현되어 있다. 브라우저용 WebAssembly, ONNX Runtime Web 등 커뮤니티 포팅이 존재해 서버 없는 클라이언트 사이드 실행이 가능하며 긴 텍스트도 연속 스트리밍으로 처리할 수 있다는 점이 이 프로젝트의 핵심 가치이나 README는 GPU에서의 가속 이득이 관찰되지 않았음을 명시해 CPU 최적화에 초점이 맞춰져 있음을 분명히 하고 있다.
핵심 포인트
- GPU나 클라우드 TTS API 없이도 CPU만으로 실시간 수준의 합성이 가능한 경량 모델 설계를 채택한다.
- voice state를 safetensors로 내보내고 디스크에서 kvcache를 직접 읽어 빠르게 음성을 복원하는 워크플로를 제공한다.
- 브라우저용 WebAssembly와 ONNX Runtime Web 등으로 커뮤니티 포팅이 활발해 클라이언트 사이드 실행 옵션이 다양하다.
- CPU에서 실행해 GPU나 외부 API 없이 로컬에서 음성을 생성할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| initial_latency | time-to-first-chunk | ≈200ms | — |
| throughput_cpu | real-time-speed-multiplier | ~6x real-time on MacBook Air M4 | — |
| model_size | parameters | 100M parameters | — |
| cpu_usage | cpu-cores | uses only 2 CPU cores | — |
7k
STARS
702
FORKS
+208
TRENDING
2
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.