owensong/Inflect-Nano-v2
텍스트를 24kHz 단일 채널 파형으로 합성하는 영어 고정 보이스 텍스트-투-스피치3.97Mapache-2.0
4M 파라미터 미만으로 CPU에서 실시간보다 10배 빠르게 도는 로컬 영어 TTS 모델
TL;DR
Inflect-Nano-v2는 VITS 계열을 기반으로 설계된 3.97M 파라미터의 로컬 영어 텍스트-투-스피치 모델로, 통합 파형 디코더까지 포함해 24kHz 모노 출력을 15.97MB FP32 패키지로 제공한다. 구두점 인식 기반 청크 분할과 결정론적 시드로 긴 텍스트도 안정적으로 재현 가능한 음성을 만들며, CPU 4스레드 기준 실시간의 10.72배 속도로 동작한다. 커뮤니티 블라인드 청취 평가에서 선호율 63.9%, UTMOS22 4.386을 기록해 KittenTTS·Piper·Supertonic 같은 기존 경량 TTS와 같은 프로토콜로 비교 평가됐다(카드는 특정 지표로 우위를 주장하지 않는다). 다만 영어 고정 보이스 하나만 지원하고 낯선 표현·숫자·고유명사에서는 발화가 불안정해질 수 있어, 오프라인·엣지 환경의 안내 음성이나 로컬 도구용으로 적합하다.
핵심 포인트
- 3.97M 파라미터·15.97MB로 통합 파형 디코더까지 포함해 완전한 로컬 TTS를 CPU에서 실시간의 10.72배 속도로 돌린다.
- 커뮤니티 블라인드 청취 선호율 63.9%(22승 12패 2무), UTMOS22 4.386을 측정 조건과 함께 공개했다.
- 구두점 인식 기반 청크 분할과 결정론적 시드로 긴 텍스트도 안정적으로 재현 가능한 출력을 낸다.
제한사항
- 영어 고정 보이스 하나만 지원하며 제로샷 음성 클로닝은 불가능하다.
- 낯선 표현이나 숫자·약어·고유명사에서 발화가 불안정해질 수 있다.
- 의료·법률·응급 등 안전이 중요한 용도로는 검증되지 않았다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Community preference | blind preference | 63.9% | — |
| UTMOS22 | predicted naturalness | 4.386 | 95% 부트스트랩 신뢰구간 4.372~4.399 |
| Two-ASR semantic WER | WER | 4.21% | — |
| FP32 weights | size | 15.97MB | — |
| CPU throughput | real-time factor | 10.72x | — |
126
LIKES
838
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.