OpenBMB/VoxCPM
Python30 / 0
토크나이저 프리 확산 자회귀 아키텍처로 48kHz 다국어 음성 합성과 텍스트 기반 목소리 설계 및 고정밀 복제를 제공한다.
TL;DR
VoxCPM2는 토크나이저 없이 AudioVAE V2의 연속 잠재공간에서 확산 자회귀 방식으로 음성을 직접 생성하는 2B 규모의 다국어 TTS 플랫폼이다. 이 모델은 텍스트만으로 새로운 목소리를 설계하는 Voice Design과 짧은 참조 오디오로 음색을 복제하며 스타일을 제어하는 Controllable/Ultimate Cloning을 지원하고 별도 업샘플러 없이 48kHz 스튜디오급 출력을 제공한다. 실시간 스트리밍 구현에서 RTX 4090 기준 RTF 약 0.3, Nano-vLLM 기반 가속 시 약 0.13의 성능을 보고하고 있으며 가중치와 코드를 Apache-2.0으로 공개해 상업적 사용 경로를 열었다. 악용 우려와 컨트롤러블 생성의 일관성 문제, 지원 언어 범위 등 운영상 주의사항이 README에 명시되어 있다.
핵심 포인트
- 토크나이저 프리 설계를 채택하여 이산 토큰화로 인한 품질 손실과 언어별 토크나이징 이슈를 회피한다.
- AudioVAE V2의 비대칭 인코더·디코더와 내장 슈퍼레졸루션을 통해 별도 업샘플러 없이 48kHz 스튜디오급 출력을 직접 생성한다.
- 텍스트 기반 Voice Design과 참조 기반 Controllable/Ultimate Cloning을 동일한 파이프라인에서 지원하여 스타일 제어와 고유 화자 보존을 모두 제공한다.
- 다양한 언어의 입력 텍스트를 30개 언어로 직접 합성하여 별도 언어 태그 없이 출력을 생성한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Seed-TTS-eval (test-EN WER) | WER% | 1.84 | VoxCPM1.5: 2.12 |
| Internal 30-Language ASR Benchmark (Average) | Average error% | 1.68 | — |
| InstructTTSEval (APS ZH) | APS | 85.2 | Qwen3-TTS: 85.2 |
이미지 분석

33.4k
STARS
3.8k
FORKS
+211
TRENDING
30
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.