본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

owensong/Inflect-Nano-v1

텍스트→웨이브폼(text-to-speech) 합성: 영어 입력을 멜 스펙트로그램으로 변환해 24 kHz 파형으로 재구성(단일 남성 화자, duration/pitch/energy/brightness 예측 포함).Total 4.632M (Acoustic 3.465M, Vocoder 1.167M)apache-2.0

음향모델과 보코더를 합쳐 총 4.63M 파라미터로 24 kHz 영어 음성을 로컬에서 생성하는 초경량 non-autoregressive TTS 스택이다.

TL;DR

Inflect-Nano-v1은 음향모델과 보코더를 합쳐 총 4.632M 파라미터로 동작하는 초소형 영어 텍스트-투-스피치 스택이다. 텍스트 전처리→FastSpeech-style 음향모델(encoder 5 layer, decoder 6 layer, hidden size 168)→80-bin 멜 스펙트로그램→Snake 활성화 기반 HiFi-GAN-style 보코더의 단일 파이프라인으로 24 kHz 파형을 생성한다. 사용자 제어를 위해 duration·pitch·energy·brightness를 예측하며 CLI와 Gradio 데모를 통해 로컬 CPU 환경에서도 실행 가능하다. 모델은 초경량 실험·임베디드 데모·오프라인 보조 등에 적합하지만 README는 보코더가 품질 병목이 될 수 있고 프로덕션 내레이션·멀티링구얼·고품질 오디오 용도로는 권장하지 않는다고 명시했다.

핵심 포인트

  • 음향모델과 보코더를 모두 포함해 배포되는 '완전 추론 스택'으로 총 파라미터를 4.632M으로 제한한 점
  • 24 kHz 출력과 80-bin 멜 구성으로 비교적 높은 샘플레이트를 유지하면서도 초경량을 달성한 설계
  • Snake 활성화 기반의 소형 HiFi-GAN-style 보코더 채택으로 보코더를 모델 패키지에 포함시킨 점
  • 전체 추론 스택(음향모델+보코더)을 단일 배포에 포함해 총 파라미터를 5M 미만(4.632M)으로 유지했다는 점이 명확한 강점이다(README의 Model Size 표 근거).

207

LIKES

0

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.