37.5MB로 24kHz 로컬 합성이 가능한 영어 TTS 마이크로 모델
Inflect-Micro-v2는 VITS 계열 설계로 9.36M 파라미터 아래에서 24 kHz 모노 파형을 로컬에서 빠르게 합성하는 영어 고정 음성 TTS이다.
TL;DR
Inflect-Micro-v2는 VITS 계열의 파라미터 효율적 end-to-end 설계를 통해 9.36M 파라미터로 24 kHz 모노 파형을 로컬에서 직접 합성하는 영어 TTS 모델이다. 텍스트 전처리로 eSpeak-ng 기반의 음소화와 구두점 인식으로 긴 문단을 문장 단위로 분할해 합성한 뒤 에지 페이드로 이어붙이는 방식으로 메모리와 안정성을 관리하며 seed·variation·speed로 재현성과 발화 다양성을 제어한다. 공개 평가에서 커뮤니티 선호도 66.2%, UTMOS22 4.395, Two-ASR semantic WER 3.99%와 같은 수치를 보고했고 전체 FP32 패키지는 37.53 MB로 엣지·로컬 배포에 적합하다. 훈련 파이프라인과 일부 최적화 레시피는 비공개로 남아 있어 새 음성·언어 적응은 현재 검증되지 않았고 긴 글 처리에서 연결부 품질에 트레이드오프가 존재한다.
핵심 역량
- 단일 고정 음성으로 영어 텍스트를 24 kHz 모노 float32 웨이브폼으로 변환할 수 있다. 프론트엔드에서 텍스트 정규화와 음소화가 이루어지며 구두점을 인식해 긴 문단을 문장 단위로 분할하고 합성한 결과를 이어붙인다. 시드 제어와 variation·speed 파라미터로 반복 재현성과 발화 다양성 조절이 가능하다.
- CPU와 CUDA 환경 모두에서 동일한 Python API로 추론을 실행할 수 있다. 패키지에는 ONNX FP32 그래프가 별도 공개되어 프레임워크 독립적 배포가 가능하며 동적 길이 지원과 동일한 long-text 처리 래퍼를 유지한다. 네이티브 PyTorch 런타임과 ONNX Runtime 모두에서 재현 가능한 출력을 얻을 수 있다.
- 작은 배포 풋프린트로 로컬·엣지 배포를 목표로 설계되었다. Micro는 37.53 MB FP32 전체 가중치 패키지를 제공하여 로컬 디바이스에 직접 배포할 수 있으며 Nano 옵션은 더 작은 15.97 MB 패키지를 제공해 더 제한된 환경을 겨냥한다. 패키지에는 inference 코드, 프론트엔드 스크립트, 평가 프로토콜이 포함되어 배포와 감사 가능성이 확보되어 있다.
강점
- 작은 전체 패키지 크기로 로컬 배포를 목표로 하는 장점이 있다. Inflect-Micro-v2는 FP32 패키지 전체가 37.53 MB로 보고되어 경량 장치나 엣지 환경에서 직접 배포와 실행이 가능하다. 통합 파형 디코더를 포함한 완전한 text-to-waveform 경로를 한 패키지로 제공해 의존성 축소와 배포 단순화가 실현되었다.
- 청취 선호도와 예측된 자연스러움 지표에서 동급 비교군 대비 경쟁력 있는 결과를 보였다. 커뮤니티 블라인드 리스닝에서 66.2%의 선호도를 기록했으며 UTMOS22 예측값은 4.395로 보고되어 작은 모델 치고 높은 자연스러움 예측을 달성했다. 이러한 결과는 품질 우선 설계(Inflect-Micro 구성)의 목표가 성과로 연결되었음을 시사한다.
- CPU 환경에서 실용적인 속도를 달성한 점이 돋보인다. 표준화된 8 vCPU 기준 네 스레드의 관리형 참조 런에서 steady-state RTF 0.1593에 해당하는 6.28× 실시간 생성률을 기록해 추가 최적화 없이도 로컬 CPU 실행이 가능함을 입증했다. 다만 비교 행렬에서는 ONNX나 프레임워크 최적화를 적용한 다른 시스템이 더 높은 실시간 배율을 보였으므로 환경별 성능 차이는 존재한다.
훈련 방식
Inflect v2는 VITS 계열의 파라미터 효율적 end-to-end 구조를 기반으로 훈련되었으며 모노토닉 정렬, 확률적 잠재 샘플링, residual coupling flow 및 통합 파형 디코더를 조합해 텍스트에서 직접 파형을 생성한다. 공개 패키지에는 배포 가능한 가중치와 추론 코드가 포함되어 있으나 학습용 코퍼스 구성과 최종 최적화 레시피는 비공개로 유지되어 있다. 새로운 음성이나 언어 적응은 현재 검증된 절차가 아니며 적응을 위해서는 전처리 규칙, 음소 사전, 임베딩 재구성 및 데이터 재구성이 필요하다.
알아두면 좋은 것
- 공개된 평가는 인간 선호도, 예측 자연스러움(UTMOS22), 다중 ASR 기반 의미적 WER, 전체 FP32 패키지 크기, CPU 런타임을 각각 별도 지표로 보고한다. Human blind preference에서는 Inflect-Micro-v2가 66.2%의 커뮤니티 선호도를 기록했으며 UTMOS22는 4.395로 보고되었다. 평가 프로토콜과 원시 ASR 가설, 프롬프트, 해시는 리포트 디렉토리에 동봉되어 감사 가능성이 확보되어 있다.
- ONNX FP32 공식 내보내기가 별도 리포지토리로 제공되어 PyTorch 의존 없이 ONNX Runtime으로 동작하는 런타임 경로를 지원한다. ONNX 경로는 dynamic length, CPU/CUDA/DirectML 제공자 선택, deterministic seed 및 동일한 long-text 래퍼를 포함하여 배포 유연성을 제공한다. ONNX 리포지토리에는 그래프 계약, 출처, 동등성 보고서가 포함되어 있다.
- 긴 텍스트는 구두점 인식 기반 분할로 처리되며 각 청크는 짧은 일시정지와 에지 페이드를 통해 이어붙여진다. 이 방식은 한 번에 무제한 autoregressive 합성을 하지 않고 경계별로 합성해 메모리와 안정성을 관리하는 전략이다. 그 결과 긴 글에서 연결부의 표현이 연속적 한 모델 패스와 달라질 수 있는 트레이드오프가 존재한다.
- 이 릴리스는 공개 가중치와 추론 코드를 포함하되 훈련용 데이터 생성 파이프라인과 개인화된 필터링 인프라는 공개하지 않는다. 새 음성이나 다른 언어로의 적응은 현재 검증되지 않았으며 새로운 음성은 선택적 다중 음성 추가 방식이 아닌 기존 고정 음성을 대체하는 방식으로 적용되어야 한다. 책임 있는 사용과 합성 음성 표시에 대한 라이선스·법적 요구를 명확히 하고 있다.
기술적 특징
- 파라미터 예산을 엄격히 관리한 VITS 계열 설계를 채택해 end-to-end 텍스트→파형 경로를 통합했다. 텍스트 프론트엔드에서 English eSpeak-ng를 통해 정규화·음소화·구두점 인식을 처리하고, 잠재 표현은 flow 기반 결합 블록과 residual coupling flow로 변환되어 디코더로 전달된다. 이 구성은 작은 파라미터 수로도 자연스러운 발화 품질을 유지하도록 균형을 맞춘 설계이다.
- 긴 텍스트 처리를 위해 구두점 기반 분할과 청크 합성 전략을 도입했다. 입력 문자열을 문장 경계에 따라 분할하고 각 청크를 개별적으로 합성한 뒤 짧은 일시정지와 에지 페이드를 사용해 이어붙이는 방식으로 메모리와 안정성 요구를 낮췄다. 이 방식은 긴 문단을 처리할 때 시스템의 메모리 사용량을 통제하면서도 일관된 처리량을 유지하도록 설계되었다.
- 결과 재현성과 제어를 위해 seed, variation, speed 같은 런타임 제어 파라미터를 노출했다. seed는 동일한 런타임 스택에서 동일한 잠재 샘플을 반복 재생성하게 하고 variation은 잠재 샘플의 분산을 조절해 발화 다양성을 바꾼다. 이 제어 체계는 비교 평가와 디버깅, 데모 재현성 확보에 유용하도록 설계되었다.
- 배포 유연성을 위해 PyTorch 기반 참조 런타임과 별도의 공식 ONNX FP32 내보내기를 제공한다. ONNX 경로는 dynamic length를 지원하고 CPU/CUDA/DirectML 제공자를 선택할 수 있어 PyTorch가 없는 환경에서도 동일한 long-text 래퍼와 결정적 시드 기능을 유지한다. 이중 경로 제공은 엣지 배포와 다양한 실행 스택에서의 동등성 확보를 목표로 한다.
차별점
- 9.36M 파라미터 수준에서 통합 파형 디코더를 포함한 완전한 text-to-waveform 패키지를 제공해 같은 계열의 더 작은 모델들과 배포 대비 품질을 차별화했다. 이 모델은 Micro 구성으로 37.53 MB의 FP32 전체 패키지 크기를 기록해 로컬 배포를 용이하게 구성했다. 같은 API로 Nano와 Micro를 교체해 동일한 인터페이스로 품질·크기 트레이드오프를 선택할 수 있다.
- 평가 투명성과 감사 가능성을 우선해 고정 프롬프트·원시 ASR 가설·부트스트랩 신뢰구간 등을 포함한 냉동된 평가 아티팩트를 공개했다. Human blind preference, UTMOS22, 다중 ASR 기반 의미적 WER 등 다양한 지표를 분리 보고함으로써 단일 합성 점수에 의존하지 않는 비교 방식을 채택했다. 공개된 프로토콜과 결과 집합은 재현성과 비교 분석을 쉽게 만든다.
- ONNX FP32 공식 내보내기를 별도 저장소로 제공해 토치 프리 경로와 브라우저·DirectML·다양한 제공자에서의 실행을 지원한다. 내보내기는 duration.onnx와 decode.onnx로 분할되어 전체 학습된 경로를 그래프로 포함하며 파리티 측정과 체크섬, 재현성 보고서를 포함한다. 이 구성은 PyTorch가 없는 환경에서의 배포 장벽을 낮추는 차별점이다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Community blind preference | preference-rate | 66.2% | — |
| UTMOS22 | UTMOS22 | 4.395 | — |
| Two-ASR semantic WER | semantic WER | 3.99% | — |
| Complete FP32 weights | package size | 37.53 MB | — |
| 4-thread CPU throughput | real-time factor | 6.28× real-time | — |
316
Likes
1.1k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.