97ms 지연의 스트리밍 TTS와 10개 언어 커스텀 보이스
Qwen3-TTS-12Hz-1.7B-CustomVoice는 discrete multi-codebook LM과 전용 12Hz 토크나이저를 결합해 지시 기반 다국어 텍스트-투-스피치를 저지연 스트리밍으로 제공한다.
TL;DR
Qwen3-TTS-12Hz-1.7B-CustomVoice는 전용 12Hz 토크나이저로 음성을 이산 코드로 압축하고 discrete multi-codebook LM으로 end-to-end 학습해 다국어 지시 기반 음성 합성과 음성 디자인·클론 기능을 제공한다. 모델은 듀얼 트랙 하이브리드 스트리밍 구조를 통해 문자 입력 한 글자로 첫 오디오 패킷을 즉시 출력하고 전체 end-to-end 지연을 README 기준으로 97ms까지 낮추어 실시간 상호작용 요구를 충족시킨다. 공개된 벤치마크는 Qwen3-TTS 계열이 여러 언어에서 낮은 WER와 비교적 높은 스피커 유사도를 달성함을 보여주며 VoiceDesign·CustomVoice·Base 변형을 통해 다양한 애플리케이션 워크플로를 문서화하고 있다. 단점으로 명시된 훈련 기법 세부와 파라미터 수는 README에 구체적 수치로 모두 공개되어 있지 않으므로 리소스 계획 시 모델 파일 크기와 실행 옵션을 직접 확인해야 한다.
핵심 역량
- 지시문(instruct)을 입력해 음색, 감정, 말투, 속도 같은 다차원 음성 속성을 자연어로 제어할 수 있으며 이를 바탕으로 다양한 페르소나의 음성을 합성할 수 있다. 이 기능은 모델이 텍스트의 의미와 지시어를 통합해 출력 성향을 조절하도록 설계되어 있다. 사용자 제공의 스피커 식별자 또는 참조 오디오를 통해 목표 음색으로의 적응이 가능하다.
- 스트리밍 모드와 비스트리밍 모드를 단일 모델에서 모두 지원하므로, 문자 입력 한 글자로 첫 오디오 패킷을 즉시 생성하고 이후 연속 패킷을 낮은 지연으로 제공할 수 있다. README에 따르면 전체 end-to-end 합성 지연이 97ms까지 보고되어 실시간 인터랙티브 시나리오에 적합하다. 이 특성은 듀얼 트랙 하이브리드 스트리밍 구조로 달성된다.
- 다국어 합성과 타깃 스피커 유사도 보존을 목표로 하며 10개 주요 언어(중/영/일/한/독/프/러/포르/스페인/이탈리아어)를 지원한다. 모델군에는 CustomVoice, VoiceDesign, Base 변형이 있어 음성 디자인 생성과 생성물을 재사용 가능한 클론 프롬프트로 전환하는 워크플로가 문서화되어 있다. 토크나이저와 모델 인터페이스는 qwen-tts 패키지를 통해 사용 가능하다.
강점
- 토크나이저 기반의 이산 코드 표현과 multi-codebook LM 결합으로 음향 정보와 발화 특성을 높은 보존률로 모델링할 수 있다.
- 듀얼 트랙 스트리밍 설계로 매우 낮은 초반 출력 지연(README에 97ms 명시)을 달성해 실시간 상호작용에 적합하다.
- 다국어·다음변(다중 음색) 지원과 VoiceDesign·CustomVoice·Base 계열 제공으로 실제 애플리케이션별 워크플로를 문서화해 배포 편의성을 제공한다.
훈련 방식
모델은 Qwen3-TTS-Tokenizer-12Hz로 음성을 이산 코드로 인코딩하고 discrete multi-codebook LM 구조로 end-to-end 학습되어 텍스트 의미와 음향 정보를 통합적으로 모델링하도록 설계되었다.
알아두면 좋은 것
- Qwen3-TTS는 Qwen3-TTS-Tokenizer-12Hz를 사용해 음성을 12Hz 단위의 이산 코드로 인코딩·디코딩하며 코덱 표현을 통해 고차원 의미와 패럴링구이스틱 정보를 보존한다.
- 아키텍처는 discrete multi-codebook LM을 중심으로 설계되어 전형적 LM+DiT 파이프라인의 병목과 누적 오류를 회피하고 end-to-end 음성 모델링 효율을 끌어올렸다.
- 듀얼 트랙 하이브리드 스트리밍 구조로 스트리밍과 비스트리밍 출력을 동일 모델에서 지원하며 README에 97ms의 end-to-end 합성 지연이 명시되어 있다.
- qwen-tts Python 패키지와 vLLM-Omni에서 초기 지원을 제공하며 Hugging Face·ModelScope를 통한 모델 다운로드와 로컬 데모 실행 방법이 문서에 포함되어 있다.
기술적 특징
- Qwen3-TTS는 Qwen3-TTS-Tokenizer-12Hz를 중심으로 음향을 12Hz 단위의 이산 코드로 압축하고 이를 discrete multi-codebook LM에 입력해 의미와 음향 특징을 동시에 모델링했다. 이 접근은 연속 스펙트럼 예측 대신 코드 예측을 사용함으로써 디코더의 계산량을 줄이고 재생 시 정보 손실을 줄이는 효과를 낸다. 결과적으로 경량 비-DiT(디토네이터 없음) 구조에서도 고품질 음성 재구성이 가능하도록 설계되었다.
- 아키텍처는 여러 코드북을 병렬로 운영해 서로 다른 음향 차원(예: 포먼트·주파수·환경 잡음)을 분리된 채널로 표현하고, 이를 LM이 통합적으로 예측하도록 구성되었다. 이러한 분해는 모델이 발화의 패럴링구이스틱 세부를 잃지 않으면서도 텍스트 의미와 발화 스타일을 결합하여 출력할 수 있게 한다. README는 이 설계가 기존 LM+DiT 파이프라인에서 발생하는 병목과 누적 오류를 회피한다고 명시했다.
- 듀얼 트랙 하이브리드 스트리밍은 입력 문자 단위의 빠른 응답 경로와 고품질 연속 출력 경로를 분리해 동시에 운영함으로써 첫 오디오 패킷을 즉시 전송하고 뒤이은 패킷을 안정적으로 이어붙이는 방식으로 동작한다. 이로 인해 초기 응답 지연은 매우 낮게 유지되며 전체 합성 파이프라인 레이턴시는 README의 측정치로 97ms 수준까지 보고되었다. 구조적으로는 스트리밍 전용 패스와 전체 문맥을 반영하는 패스가 협력하는 형태이다.
- 플랫폼 통합성과 실행 효율을 위해 qwen-tts Python 패키지와 vLLM-Omni 예시를 제공하고 FlashAttention 2 사용을 권장해 메모리 사용과 연산 효율을 개선하도록 안내했다. 설치 지침은 conda 환경 구성과 flash-attn 의존성 옵션을 포함하며 README는 torch.bfloat16 또는 torch.float16 모드에서 FlashAttention 2를 사용할 것을 권고했다. 이 점은 대규모 실 기기에서의 추론 최적화와 호환성 측면에서 중요하다.
차별점
- 전용 12Hz 토크나이저를 통해 음향 정보와 의미 정보의 고밀도 압축을 달성해 경량 비-DiT 구조에서도 고품질 재생을 유지한다.
- 단일 모델로 스트리밍과 비스트리밍을 모두 지원하는 듀얼 트랙 하이브리드 스트리밍 아키텍처를 채택해 초저지연 첫 패킷 출력을 가능하게 한다.
- VoiceDesign, CustomVoice, Base의 모델 계열을 제공해 자연어 지시 기반 음성 디자인과 이를 재사용 가능한 클론 프롬프트로 변환하는 실무 워크플로를 문서화했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Seed-TTS test-zh Qwen3-TTS-12Hz-1.7B-Base | WER | 0.77 | — |
| Seed-TTS test-en Qwen3-TTS-12Hz-1.7B-Base | WER | 1.24 | — |
| InstructTTSEval-ZH Qwen3-TTS-12Hz-1.7B-CustomVoice APS | APS | 83.0 | — |
| InstructTTSEval-ZH Qwen3-TTS-12Hz-1.7B-CustomVoice DSD | DSD | 77.8 | — |
| InstructTTSEval-ZH Qwen3-TTS-12Hz-1.7B-CustomVoice RP | RP | 61.2 | — |
| Target-Speaker Multilingual Chinese Qwen3-TTS-12Hz-1.7B-CustomVoice | WER | 0.903 | — |
| Cross-Lingual en-to-zh Qwen3-TTS-12Hz-1.7B-Base | Mixed Error Rate | 4.77 | — |
이미지 분석


1.8k
Likes
2.5M
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.