본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

owensong/Inflect-Micro-v2

텍스트-투-스피치(TTS) — 10M 파라미터 이하 완전 로컬 실행용 고정 목소리 합성9,356,513apache-2.0

Owen Song이 독립 개발한 936만 파라미터급 로컬 TTS로 CPU에서도 실시간보다 6배 빠르게 고정 목소리 음성을 합성한다.

학습 방식 · VITS 계열 종단형 텍스트-투-파형 아키텍처(잠재 채널 192, 인코더 3층/2헤드, 플로우 커플링 4블록)를 처음부터 학습했으며, 학습 코퍼스 생성·필터링 파이프라인과 세부 최적화 레시피는 비공개다.

TL;DR

Inflect-Micro-v2는 개인 개발자 Owen Song이 독립적으로 만든 936만 파라미터, 37.53MB 크기의 VITS 계열 종단형 TTS로, CPU·CUDA 어디서나 결정론적 시드로 24kHz 모노 파형을 로컬에서 바로 생성한다. 익명 커뮤니티 블라인드 청취 평가에서 66.2%의 선호율을 얻었고 UTMOS22 예측 자연스러움 4.395, 두 개의 ASR(Qwen3-ASR·Nemotron 3.5) 평균 의미 WER 3.99%로, 자체보다 파일 크기가 큰 KittenTTS Nano·Piper Low·Supertonic 3 같은 경량 TTS와 비교 평가됐다. 4-스레드 CPU 기준 6.28배 실시간 처리량을 내며 긴 텍스트는 구두점 기준으로 나눠 순차 합성한 뒤 이어 붙이는 방식으로 처리한다. 영어 한 가지 고정 남성 목소리만 제공하며 제로샷 목소리 클로닝은 아니고, 별도의 적응 툴킷으로 다른 고정 목소리나 언어로 파인튠할 수 있다.

핵심 포인트

  • 936만 파라미터·37.53MB로 KittenTTS Nano·Piper Low 등 더 큰 경량 TTS와 비교돼 블라인드 선호율 66.2%를 얻었다.
  • 4스레드 CPU에서 6.28배 실시간 처리량을 내며 CPU/CUDA를 같은 Python API로 지원한다.
  • 두 개의 서로 다른 ASR(Qwen3-ASR·Nemotron 3.5) 평균 WER 3.99%로 의미적 명료도를 측정해 공개했다.
  • 고정 목소리 하나만 제공하며 화자 클로닝이 아니라, 별도 적응 툴킷으로 새 목소리·언어를 재학습해 교체하는 방식을 지원한다.

제한사항

  • 영어 한 가지 고정 남성 목소리만 제공하며 화자 클로닝 기능은 없다.
  • 낯선 어투의 문장은 더 평탄하거나 불안정하게 들릴 수 있다.
  • 숫자·약어·동형이의어·희귀 고유명사는 프론트엔드와 문맥에 따라 결과가 달라질 수 있다.

벤치마크

벤치마크지표비교
커뮤니티 블라인드 선호율%66.221승 10패 3동
두 ASR 평균 semantic WERWER%3.99
4스레드 CPU 처리량실시간 배속6.28×

418

LIKES

2.2k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.