본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

owensong/Inflect-Nano-v2

텍스트를 24kHz 단일 채널 파형으로 합성하는 영어 고정 보이스 텍스트-투-스피치3.97Mapache-2.0

4M 파라미터 미만으로 CPU에서 실시간보다 10배 빠르게 도는 로컬 영어 TTS 모델

TL;DR

Inflect-Nano-v2는 VITS 계열을 기반으로 설계된 3.97M 파라미터의 로컬 영어 텍스트-투-스피치 모델로, 통합 파형 디코더까지 포함해 24kHz 모노 출력을 15.97MB FP32 패키지로 제공한다. 구두점 인식 기반 청크 분할과 결정론적 시드로 긴 텍스트도 안정적으로 재현 가능한 음성을 만들며, CPU 4스레드 기준 실시간의 10.72배 속도로 동작한다. 커뮤니티 블라인드 청취 평가에서 선호율 63.9%, UTMOS22 4.386을 기록해 KittenTTS·Piper·Supertonic 같은 기존 경량 TTS와 같은 프로토콜로 비교 평가됐다(카드는 특정 지표로 우위를 주장하지 않는다). 다만 영어 고정 보이스 하나만 지원하고 낯선 표현·숫자·고유명사에서는 발화가 불안정해질 수 있어, 오프라인·엣지 환경의 안내 음성이나 로컬 도구용으로 적합하다.

핵심 포인트

  • 3.97M 파라미터·15.97MB로 통합 파형 디코더까지 포함해 완전한 로컬 TTS를 CPU에서 실시간의 10.72배 속도로 돌린다.
  • 커뮤니티 블라인드 청취 선호율 63.9%(22승 12패 2무), UTMOS22 4.386을 측정 조건과 함께 공개했다.
  • 구두점 인식 기반 청크 분할과 결정론적 시드로 긴 텍스트도 안정적으로 재현 가능한 출력을 낸다.

제한사항

  • 영어 고정 보이스 하나만 지원하며 제로샷 음성 클로닝은 불가능하다.
  • 낯선 표현이나 숫자·약어·고유명사에서 발화가 불안정해질 수 있다.
  • 의료·법률·응급 등 안전이 중요한 용도로는 검증되지 않았다.

벤치마크

벤치마크지표비교
Community preferenceblind preference63.9%
UTMOS22predicted naturalness4.38695% 부트스트랩 신뢰구간 4.372~4.399
Two-ASR semantic WERWER4.21%
FP32 weightssize15.97MB
CPU throughputreal-time factor10.72x

126

LIKES

838

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.