본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

OpenBMB/VoxCPM

Python30 / 0

토크나이저 프리 확산 자회귀 아키텍처로 48kHz 다국어 음성 합성과 텍스트 기반 목소리 설계 및 고정밀 복제를 제공한다.

TL;DR

VoxCPM2는 토크나이저 없이 AudioVAE V2의 연속 잠재공간에서 확산 자회귀 방식으로 음성을 직접 생성하는 2B 규모의 다국어 TTS 플랫폼이다. 이 모델은 텍스트만으로 새로운 목소리를 설계하는 Voice Design과 짧은 참조 오디오로 음색을 복제하며 스타일을 제어하는 Controllable/Ultimate Cloning을 지원하고 별도 업샘플러 없이 48kHz 스튜디오급 출력을 제공한다. 실시간 스트리밍 구현에서 RTX 4090 기준 RTF 약 0.3, Nano-vLLM 기반 가속 시 약 0.13의 성능을 보고하고 있으며 가중치와 코드를 Apache-2.0으로 공개해 상업적 사용 경로를 열었다. 악용 우려와 컨트롤러블 생성의 일관성 문제, 지원 언어 범위 등 운영상 주의사항이 README에 명시되어 있다.

핵심 포인트

  • 토크나이저 프리 설계를 채택하여 이산 토큰화로 인한 품질 손실과 언어별 토크나이징 이슈를 회피한다.
  • AudioVAE V2의 비대칭 인코더·디코더와 내장 슈퍼레졸루션을 통해 별도 업샘플러 없이 48kHz 스튜디오급 출력을 직접 생성한다.
  • 텍스트 기반 Voice Design과 참조 기반 Controllable/Ultimate Cloning을 동일한 파이프라인에서 지원하여 스타일 제어와 고유 화자 보존을 모두 제공한다.
  • 다양한 언어의 입력 텍스트를 30개 언어로 직접 합성하여 별도 언어 태그 없이 출력을 생성한다.

벤치마크

벤치마크지표비교
Seed-TTS-eval (test-EN WER)WER%1.84VoxCPM1.5: 2.12
Internal 30-Language ASR Benchmark (Average)Average error%1.68
InstructTTSEval (APS ZH)APS85.2Qwen3-TTS: 85.2

이미지 분석

모델 아키텍처 다이어그램으로 LocEnc, TSLM, RALM, LocDiT의 데이터 흐름과 AudioVAE V2 기반 잠재 표상 연결을 시각화하고 있다.
이미지는 VoxCPM2의 토크나이저 프리 파이프라인을 네 단계 흐름으로 보여주며 참조 오디오와 텍스트가 어떻게 병렬로 들어와 최종 잠재 패치 단위로 합성되는지 구조적으로 나타낸다. LocEnc에서 로컬 임베딩을 추출하고 TSLM에서 텍스트 의미를 통합한 뒤 RALM이 연속 잠재를 자회귀적으로 생성하고 LocDiT가 패치 수준의 흐름 매칭으로 재구성하는 처리 파이프라인이 도식화되어 있어 시스템 구성과 모듈 간 인터페이스를 한눈에 파악할 수 있다.

33.4k

STARS

3.8k

FORKS

+211

TRENDING

30

조회수

watchers 33.4kopen issues 92Apache License 2.0

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.