2B 파라미터·30개 언어 지원 48kHz 다국어 TTS 플랫폼
토크나이저 프리 확산 자회귀 아키텍처로 48kHz 다국어 음성 합성과 텍스트 기반 목소리 설계 및 고정밀 복제를 제공한다.
TL;DR
VoxCPM2는 토크나이저 없이 AudioVAE V2의 연속 잠재공간에서 확산 자회귀 방식으로 음성을 직접 생성하는 2B 규모의 다국어 TTS 플랫폼이다. 이 모델은 텍스트만으로 새로운 목소리를 설계하는 Voice Design과 짧은 참조 오디오로 음색을 복제하며 스타일을 제어하는 Controllable/Ultimate Cloning을 지원하고 별도 업샘플러 없이 48kHz 스튜디오급 출력을 제공한다. 실시간 스트리밍 구현에서 RTX 4090 기준 RTF 약 0.3, Nano-vLLM 기반 가속 시 약 0.13의 성능을 보고하고 있으며 가중치와 코드를 Apache-2.0으로 공개해 상업적 사용 경로를 열었다. 악용 우려와 컨트롤러블 생성의 일관성 문제, 지원 언어 범위 등 운영상 주의사항이 README에 명시되어 있다.
주요 기능
- 다양한 언어의 입력 텍스트를 30개 언어로 직접 합성하여 별도 언어 태그 없이 출력을 생성한다.
- 자연어 설명으로 새로운 목소리를 생성하는 Voice Design을 지원하여 참조 오디오 없이도 음색과 스타일을 지정할 수 있다.
- 짧은 참조 오디오로 화자의 음색을 복제하고 스타일 조절을 통해 속도·감정·표현을 제어하는 Controllable Cloning 기능을 제공한다.
- AudioVAE V2의 비대칭 인코더·디코더와 통합해 16kHz 입력을 48kHz 스튜디오 품질 출력으로 복원하며 외부 업샘플러가 필요 없다.
어떻게 동작하는가
VoxCPM2는 AudioVAE V2의 연속 잠재공간을 통해 토크나이저 없이 오디오 표현을 직접 다루는 구조이다. 모델 내부 파이프라인은 LocEnc로 로컬 오디오 임베딩을 추출한 뒤 Text-Semantic Language Model(TSLM)로 텍스트 의미를 통합하고 Residual Acoustic Language Model(RALM)이 연속 잠재를 autoregressive하게 생성하며 최종적으로 LocDiT 흐름 매칭으로 패치 수준의 잠재를 복원한다. 이 과정에서 확산 기반 디노이징 스텝이 패치 단위로 반복 적용되어 고해상도 음성 표현과 시간적 연속성을 함께 유지한다.
해결 문제
다국어 환경에서 텍스트로부터 자연스럽고 표현력 높은 음성을 생성하는 문제를 해결한다. 또한 참조 오디오가 없더라도 자연어 설명만으로 새로운 목소리를 설계하거나, 짧은 클립으로 화자 특성을 복제해 텍스트에 적용하는 음성 복제 문제를 처리한다. 장비 제약이 있는 환경에서는 Nano-vLLM 또는 llama.cpp-omni 같은 경량화된 추론 경로를 통해 실시간 스트리밍과 온디바이스 실행 요구를 충족한다.
지금 주목받는 이유
2026년 4월에 2B 파라미터, 30개 언어, Voice Design 및 48kHz 출력 지원으로 공개되었고 가중치와 코드를 Apache-2.0으로 공개하여 실무 적용 사례와 커뮤니티 확산을 촉발했다.
차별점
- 토크나이저 프리 설계를 채택하여 이산 토큰화로 인한 품질 손실과 언어별 토크나이징 이슈를 회피한다.
- AudioVAE V2의 비대칭 인코더·디코더와 내장 슈퍼레졸루션을 통해 별도 업샘플러 없이 48kHz 스튜디오급 출력을 직접 생성한다.
- 텍스트 기반 Voice Design과 참조 기반 Controllable/Ultimate Cloning을 동일한 파이프라인에서 지원하여 스타일 제어와 고유 화자 보존을 모두 제공한다.
사용 사례
- 광고·내레이션 제작에서 텍스트 설명으로 브랜드 맞춤 음성을 설계하고 고해상도 오디오를 직접 출력하는 용도로 사용한다.
- 음성 합성 기반 고객 응대나 음성 에이전트에 다국어 자연스러운 발화와 실시간 스트리밍을 적용해 응답성을 개선하는 데 활용한다.
- 미디어 복원 또는 음성 더빙에서 특정 화자를 짧은 참조로 복제해 연속된 콘텐츠를 생성하거나 기존 발화를 연장하는 데 활용한다.
시작하기
기본 설치는 pip install voxcpm으로 이루어지며 Quick Start의 예시 코드를 통해 from_pretrained로 사전학습 모델을 로드해 generate 호출로 WAV를 생성하면 된다. 로컬 대체 경로로 ModelScope 스냅샷을 내려받아 로컬 디렉토리에서 from_pretrained로 불러오는 방법도 제공된다. 고성능 서비스 필요 시 Nano-vLLM 또는 vLLM-Omni와 연계해 병렬·스트리밍 서빙을 구성할 수 있다.
요구사항
- Python >= 3.10 and < 3.13
- PyTorch >= 2.5.0
- CUDA >= 12.0 또는 MPS 지원(Apple Silicon) 사용 시 MPS 드라이버
- 실시간/고속 추론을 위한 GPU 환경에서는 VRAM 약 8GB 권장(모델별 차이 있음)
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Seed-TTS-eval (test-EN WER) | WER% | 1.84 | VoxCPM1.5: 2.12 |
| Internal 30-Language ASR Benchmark (Average) | Average error% | 1.68 | — |
| InstructTTSEval (APS ZH) | APS | 85.2 | Qwen3-TTS: 85.2 |
이미지 분석

33.4k
Stars
3.8k
Forks
+211
Trending
30
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.