3.97M 파라미터로 24kHz 로컬 합성을 지향하는 고효율 TTS
텍스트를 24 kHz 단일 채널 파형으로 합성하는 엔드투엔드 텍스트-투-스피치(영어 고정 보이스) 작업3,966,721apache-2.0
4M 미만 파라미터로 24 kHz 모노 파형을 생성하는 VITS 계열 로컬 TTS로, 결정론적 시드와 긴 텍스트 분할을 지원한다.
TL;DR
Inflect-Nano-v2는 VITS 계열을 기반으로 설계된 3.97M 파라미터의 로컬 English TTS로서 24 kHz 모노 파형을 통합 디코더까지 포함해 15.97 MB FP32로 제공한다. 모델은 residual coupling flow와 모노토닉 정렬을 결합해 잠재 샘플링의 표현력을 확보하면서도 파라미터 예산을 극단적으로 줄였고, 긴 텍스트는 구두점 인식 기반 청크 분할과 엣지 페이드로 처리한다. 평가에서는 커뮤니티 선호도 63.9%, UTMOS22 4.386, 다중 ASR 기반 의미적 WER 지표와 CPU에서 10.72× 실시간 처리량을 보고했으나 음성은 영어 고정 보이스 한 가지만 포함되며 학습 레시피와 개인화 적응법은 공개 패키지에 포함되지 않았다.
핵심 역량
- 24 kHz 모노 float32 파형을 로컬에서 합성하여 별도 디코더나 외부 오디오 레퍼런스를 요구하지 않는다.
- 결정론적 시드(seed)를 지원하여 동일 런타임 스택에서 동일한 입력은 재생산 가능한 동일 출력을 생성한다.
- 긴 입력은 구두점 기반 경계로 분할하여 청크별 합성 후 엣지 페이드와 제어된 일시정지로 이어붙여 긴 텍스트를 처리한다.
- CPU 및 CUDA에서 동작하며 공식 ONNX 경로를 통해 Torch 비의존적 런타임에서도 동일 제어와 결정성을 유지한다.
강점
- 매우 작은 배포 크기인 15.97 MB FP32와 3.97M 배포 가능한 파라미터로 엣지·로컬 배포에서 메모리와 저장 공간 제약을 크게 줄였다. 이 작은 푸트프린트에도 통합 파형 디코더를 포함해 별도 외부 컴포넌트 없이 즉시 음성을 생성할 수 있다. 결과적으로 제한된 리소스 환경에서 즉시 배포 가능한 장점을 제공한다.
- CPU에서의 처리량이 10.72× 실시간으로 보고되어 특별한 하드웨어 없이도 실시간 합성 이상의 처리 성능을 달성했다. 성능 평가는 동일한 8vCPU 환경과 4스레드 정책에서 측정된 결과로, 최적화된 ONNX 런타임과 비교해도 경쟁력 있는 속도를 보였다. 이 특성은 서버리스나 로컬 애플리케이션에서 지연과 비용을 동시에 개선할 수 있다는 실용적 이점을 의미한다.
- 사용자 기반 검증으로서 커뮤니티 블라인드 선호도 63.9%를 기록해 작은 모델군 내에서 청취자 선호 측면에서 경쟁력이 확인되었다. 다중 ASR에 기반한 의미적 WER와 예측 자연스러움 지표도 함께 제공되어 품질·이해도·무게의 균형을 객관적으로 제시했다. 다만 이러한 평가는 공개된 비교 집합과 프로토콜 맥락에 한정되는 점이 명시되어 있다.
훈련 방식
VITS 계열의 파라미터 효율적 엔드투엔드 아키텍처를 기반으로 stochastic latent synthesis와 residual coupling flow를 적용해 학습한 모델이며, 공개 패키지에는 사전 처리와 추론 코드 및 배포용 가중치가 포함되고 전체 학습 레시피와 개인화 데이터 파이프라인은 비공개로 유지되었다.
알아두면 좋은 것
- 배포 패키지는 3,966,721개의 배포 가능한 파라미터와 15.97 MB FP32 전체 가중치를 포함해 매우 작은 푸트프린트를 제공한다. 해당 패키지는 통합된 파형 디코더를 포함하여 별도 후처리 없이 로컬에서 즉시 음성을 생성할 수 있다. 공개 자료는 추정 가능한 배포 단위와 평가 아티팩트를 함께 제공하므로 배포 준비성 측면에서 이점이 있다.
- 평가 항목은 커뮤니티 선호도, 예측된 자연스러움(UTMOS22), 다중 ASR 기반 의미적 WER, 전체 가중치 크기, 런타임 처리량을 별도로 보고하는 다각적 프로토콜을 채택했다. 커뮤니티 블라인드 평가에서 Inflect-Nano-v2는 63.9%의 선호도를 기록했고 UTMOS22는 4.386으로 보고되었다. 이러한 분리된 지표 표시는 단일 통합 점수가 품질을 과대해석하는 위험을 낮췄다.
- ONNX로 검증된 FP32 익스포트 경로가 별도 리포지토리로 제공되며 그래프는 duration.onnx과 decode.onnx으로 분리되어 있다. 이 분리는 Torch 의존성을 제거한 환경에서 그래프별로 제공자(provider)를 선택해 실행할 수 있게 한다. ONNX 경로는 동적 길이 지원과 동일한 긴 텍스트 래퍼, 결정적 시드를 유지한다는 점이 명시되어 있다.
- 제한 사항으로 영어 고정 합성 보이스 하나만 포함되며 새로운 보이스나 다국어 적응은 공개적으로 검증되지 않았다. 학습용 코퍼스 생성 파이프라인과 전체 최적화 레시피는 공개 패키지에 포함되지 않아 재현성에는 추가 협업이 필요하다. 의료·법률·비상 커뮤니케이션 같은 민감한 분야에서의 사용은 검증되지 않았다.
기술적 특징
- 파라미터 예산을 극단적으로 축소한 VITS 계열 구조를 채택해 텍스트에서 파형까지의 완전한 경로를 하나의 학습 가능한 파이프라인으로 통합했다. 이 구조는 모노토닉 정렬(monotonic alignment)과 잠재 샘플링을 결합하여 짧은 파라미터 예산에서도 발화 타이밍과 정렬 안정성을 유지한다. 결과적으로 4M 미만의 배포 가능한 파라미터로 실무적 음성 품질을 확보할 수 있었다.
- Residual coupling flow 기반의 플로우 결합 블록을 사용해 잠재공간에서의 확률 분포를 가역적으로 변환함으로써 재구성 품질과 샘플링 다양성 사이의 균형을 맞추었다. 플로우 블록은 4개의 coupling block으로 구성되어 잠재 표현의 표현력을 보강하면서도 계산적 비용을 통제했다. 이러한 설계는 경량화 모델에서도 자연스러운 발음과 타이밍을 유지하게 했다.
- 통합된 alias-reduced neural waveform decoder와 다단 업샘플링(업샘플률 8,8,2,2)을 통해 24 kHz 출력 해상도를 확보하며, 초기 디코더 채널을 192로 설계해 고주파 성분 재현을 강화했다. 디코더는 스트림형 추론에서 실제적인 월-타임 성능을 제공하도록 설계되었고, 패키지 수준에서 파형 디코더까지 통합해 배포 복잡성을 낮췄다. 이로 인해 별도 후처리 없이도 고해상도 오디오를 생성할 수 있었다.
- 긴 텍스트 처리는 구두점 인식 기반의 청크 분할과 각 청크 간의 제어된 페이드 및 짧은 일시정지를 적용하는 방식으로 구현되어 입력 길이에 따른 열화 현상을 완화했다. 이 접근은 단일 장기 컨텍스트를 유지하는 대신 청크별로 안정적으로 합성한 뒤 시간적 연결을 매끄럽게 이어붙이는 방식으로 작동한다. 변형(variation) 파라미터와 speed 파라미터를 통해 출력의 발화 속도와 잠재 샘플링 변동성을 사용자가 조정할 수 있다.
- 공식 ONNX FP32 익스포트는 duration.onnx과 decode.onnx으로 그래프를 분리해 Torch 의존성을 제거한 런타임에서 동작하도록 설계되었다. 이 분리된 그래프는 동적 길이 지원과 동일한 장기 텍스트 래퍼 및 결정적 시드를 유지하도록 구성되어 ONNX Runtime 환경에서도 일관된 출력을 제공한다. 따라서 PyTorch 없는 환경이나 브라우저-근접 배포 경로에서의 통합이 용이해졌다.
차별점
- 배포 가능한 파라미터가 3,966,721개로 15.97 MB FP32 전체 가중치를 제공해 동급 소형 TTS 모델 중에서도 매우 작은 배포 크기를 달성했다. 이 작은 크기는 로컬·엣지 디바이스에서 설치·실행을 간소화하며 저장과 메모리 제약을 크게 완화한다. 특히 통합 파형 디코더까지 포함한 패키지 수준의 완결성은 별도 구성 없이 바로 배포 가능한 장점으로 연결된다.
- 결정론적 시드와 동일한 런타임 스택에서의 반복 재생산성(repeatability)을 보장하여 비교 연구와 자동화된 평가에서 재현 가능성을 확보했다. 시드 제어는 SOTA급 대형 모델에서 기대하는 변동성 관리 기능을 경량 모델에서도 동일하게 제공한다. 이로 인해 벤치마크 재현, A/B 테스트 및 품질 회귀 검증이 쉬워졌다.
- 공식 ONNX 경로로 duration/ decode 그래프를 분리해 Torch-free 실행을 지원함으로써 다양한 실행환경(CPU/CUDA/DirectML)에서 동일한 제어와 결정성을 유지할 수 있다. 이 분리는 엔지니어 관점에서 런타임 의존성 제거와 배포 유연성을 동시에 제공한다. 따라서 브라우저-인접 또는 경량 서버리스 환경에서의 통합 비용을 낮춘다.
- 긴 텍스트를 구두점 인식 기반으로 청크 분할하고 엣지 페이드와 제어된 일시정지로 이어붙이는 처리 파이프라인을 채택해 긴 형식의 텍스트 합성에서 발생하는 전이 불연속 문제를 완화했다. 이 방식은 단일 장기 컨텍스트를 유지하지 않는 대안으로 실용적 안정성과 예측 가능한 전이 거동을 제공한다. 다만 전통적 장기 연속 패스와는 음성 전이 특성이 다를 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Community preference | preference | 63.9% | — |
| UTMOS22 | UTMOS22 | 4.386 | — |
| Two-ASR semantic WER | semantic WER | 4.21% | — |
| Complete FP32 weights | size | 15.97 MB | — |
| 4-thread CPU throughput | real-time factor | 10.72× real-time | — |
119
Likes
654
Downloads
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.