합성 스택 전체를 4.63M로 묶은 초소형 영어 TTS
텍스트→웨이브폼(text-to-speech) 합성: 영어 입력을 멜 스펙트로그램으로 변환해 24 kHz 파형으로 재구성(단일 남성 화자, duration/pitch/energy/brightness 예측 포함).Total 4.632M (Acoustic 3.465M, Vocoder 1.167M)apache-2.0
음향모델과 보코더를 합쳐 총 4.63M 파라미터로 24 kHz 영어 음성을 로컬에서 생성하는 초경량 non-autoregressive TTS 스택이다.
TL;DR
Inflect-Nano-v1은 음향모델과 보코더를 합쳐 총 4.632M 파라미터로 동작하는 초소형 영어 텍스트-투-스피치 스택이다. 텍스트 전처리→FastSpeech-style 음향모델(encoder 5 layer, decoder 6 layer, hidden size 168)→80-bin 멜 스펙트로그램→Snake 활성화 기반 HiFi-GAN-style 보코더의 단일 파이프라인으로 24 kHz 파형을 생성한다. 사용자 제어를 위해 duration·pitch·energy·brightness를 예측하며 CLI와 Gradio 데모를 통해 로컬 CPU 환경에서도 실행 가능하다. 모델은 초경량 실험·임베디드 데모·오프라인 보조 등에 적합하지만 README는 보코더가 품질 병목이 될 수 있고 프로덕션 내레이션·멀티링구얼·고품질 오디오 용도로는 권장하지 않는다고 명시했다.
핵심 역량
- 영어 텍스트를 24 kHz 샘플레이트의 파형으로 직접 합성한다(텍스트→멜→보코더→웨이브).
- duration, pitch, energy, brightness 예측을 통해 발화 길이와 음색·강도·음높이 조절을 지원한다(길이/피치/에너지 스케일 인수 제공).
- 음향모델과 보코더를 포함한 완전한 추론 스택을 로컬 PyTorch 환경에서 실행한다(CPU/로컬 데모용으로 설계).
- 간단한 CLI와 Gradio 앱을 통해 즉시 데모를 실행할 수 있다.
강점
- 전체 추론 스택(음향모델+보코더)을 단일 배포에 포함해 총 파라미터를 5M 미만(4.632M)으로 유지했다는 점이 명확한 강점이다(README의 Model Size 표 근거).
- 로컬 PyTorch 환경에서 CPU 실행 가능하고 Gradio 데모를 제공해 소규모 실험·임베디드·오프라인 프로토타입에 적합하다.
알아두면 좋은 것
- 모델 총 추론 파라미터는 4.632M이며, 음향모델이 3.465M, 보코더가 1.167M으로 분리되어 배포된다.
- 출력 샘플레이트는 24 kHz이고 멜 스펙트로그램은 80-bin으로 구성된다.
- 저자 제공의 vendored 영어 텍스트 frontend가 포함되어 동일한 text normalization 및 tokenization 경로를 재현한다.
- 제작 의도는 초소형 연구·데모용이며, 보코더가 품질 병목으로 작동할 수 있어 프로덕션 사용과 고품질 나레이션에는 적합하지 않다.
기술적 특징
- 비자기회귀 FastSpeech-style 음향모델을 사용해 duration, pitch, energy, brightness를 예측한 뒤 80-bin 멜 스펙트로그램을 디코딩한다. 이 접근은 병렬 생성이 가능해 추론 속도가 빠르고 길이 제어가 용이하다.
- 음향모델은 비교적 작은 내적 차원과 얕은 스택으로 설계되어 모델 크기를 3.465M 수준으로 유지했다(encoder 5 layer, decoder 6 layer, hidden size 168). 이로 인해 메모리·연산 비용이 낮아 로컬 및 임베디드 환경에서 실행하기 적합하다.
- 보코더는 Snake 활성화 기반의 HiFi-GAN-style generator로 설계되어 24 kHz 재구성에 초점을 맞췄다. 보코더 파라미터는 1.167M에 불과해 전체 스택을 5M 미만으로 유지하는 데 기여하지만, README는 보코더가 품질 병목이라고 명시했다.
- 전체 파이프라인은 텍스트 전처리→음향모델→80-bin 멜→보코더(upsample rates 8,8,2,2)로 구성되어 단일 실행 경로로 텍스트부터 파형까지 생성된다. 보코더 업샘플 비율 및 멜 설정이 샘플레이트와 직접 연동되어 24 kHz 출력을 확보한다.
- 모델은 초경량 실험을 목표로 설계되어 파라미터 수·아키텍처 선택을 통해 로컬 실행·브라우저/WASM형 탐색·임베디드 데모에 맞춘 성능-용량 트레이드오프를 채택했다. README는 대규모 TTS와의 품질 경쟁을 의도하지 않음을 명시했다.
차별점
- 음향모델과 보코더를 모두 포함해 배포되는 '완전 추론 스택'으로 총 파라미터를 4.632M으로 제한한 점
- 24 kHz 출력과 80-bin 멜 구성으로 비교적 높은 샘플레이트를 유지하면서도 초경량을 달성한 설계
- Snake 활성화 기반의 소형 HiFi-GAN-style 보코더 채택으로 보코더를 모델 패키지에 포함시킨 점
207
Likes
0
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.