본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

kyutai-labs/pocket-tts

Python2 / 0

Pocket TTS는 100M 파라미터 경량 모델로 CPU에서 동작하며 약 200ms의 초기 지연과 실시간 대비 6배 속도를 달성하는 오픈소스 TTS이다.

TL;DR

Pocket TTS는 GPU나 원격 API 없이 로컬 CPU에서 동작하도록 설계된 약 100M 파라미터 경량 TTS로, 스트리밍으로 약 200ms 내에 첫 오디오 청크를 반환하고 MacBook Air M4 기준으로 실시간 대비 약 6배의 처리 속도를 보고한다. 음성 클로닝은 입력 오디오에서 voice state를 추출해 safetensors로 저장한 뒤 디스크에서 kvcache를 빠르게 읽어 로딩 시간을 최소화하는 방식으로 구현되어 있다. 브라우저용 WebAssembly, ONNX Runtime Web 등 커뮤니티 포팅이 존재해 서버 없는 클라이언트 사이드 실행이 가능하며 긴 텍스트도 연속 스트리밍으로 처리할 수 있다는 점이 이 프로젝트의 핵심 가치이나 README는 GPU에서의 가속 이득이 관찰되지 않았음을 명시해 CPU 최적화에 초점이 맞춰져 있음을 분명히 하고 있다.

핵심 포인트

  • GPU나 클라우드 TTS API 없이도 CPU만으로 실시간 수준의 합성이 가능한 경량 모델 설계를 채택한다.
  • voice state를 safetensors로 내보내고 디스크에서 kvcache를 직접 읽어 빠르게 음성을 복원하는 워크플로를 제공한다.
  • 브라우저용 WebAssembly와 ONNX Runtime Web 등으로 커뮤니티 포팅이 활발해 클라이언트 사이드 실행 옵션이 다양하다.
  • CPU에서 실행해 GPU나 외부 API 없이 로컬에서 음성을 생성할 수 있다.

벤치마크

벤치마크지표비교
initial_latencytime-to-first-chunk≈200ms
throughput_cpureal-time-speed-multiplier~6x real-time on MacBook Air M4
model_sizeparameters100M parameters
cpu_usagecpu-coresuses only 2 CPU cores

7k

STARS

702

FORKS

+208

TRENDING

2

조회수

watchers 7kopen issues 55MIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.