본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice

자연어 지시로 음색·감정을 제어하는 다국어 텍스트-투-스피치(9종 프리미엄 음색)1.7Bapache-2.0

97ms 지연의 스트리밍 다국어 TTS로 9종 프리미엄 음색을 지시문으로 제어하는 모델

학습 방식 · Qwen3-TTS-Tokenizer-12Hz로 음성을 압축한 뒤 discrete multi-codebook 언어모델로 텍스트·음성을 엔드투엔드 모델링하며, dual-track 스트리밍 생성 구조로 학습했다.

TL;DR

Qwen3-TTS-12Hz-1.7B-CustomVoice는 Qwen3-TTS-Tokenizer-12Hz로 음성을 압축한 뒤 discrete multi-codebook 언어모델로 텍스트와 음성을 함께 모델링하는 엔드투엔드 TTS로, 기존 LM+DiT 방식의 정보 손실과 오류 전파 없이 10개 언어와 여러 방언 음색을 지원한다. dual-track 스트리밍 생성 구조 덕분에 한 글자만 입력돼도 곧바로 첫 오디오 패킷을 낼 수 있어 종단 지연이 최소 97ms까지 낮으며, 자연어 지시로 9종 프리미엄 음색의 성별·연령·언어·방언 조합과 감정·속도를 제어할 수 있다. 텍스트 의미를 깊이 이해해 문맥에 맞는 어조와 리듬을 자동으로 조정하는 지시-따르기 능력도 함께 갖췄다. 다만 CustomVoice는 정해진 9종 음색 안에서만 스타일을 바꿀 수 있어 완전히 새로운 목소리를 클로닝하려면 별도의 Base 모델을 써야 한다.

핵심 포인트

  • 10개 언어와 다수 방언 음색을 지원하며, 자연어 지시로 음색·감정·속도를 제어할 수 있다.
  • discrete multi-codebook LM으로 음성을 엔드투엔드 모델링해 기존 LM+DiT 방식의 정보 손실과 오류 전파를 없앤다.
  • dual-track 스트리밍 구조로 한 글자만 입력돼도 즉시 첫 오디오 패킷을 낼 수 있어 지연이 97ms까지 낮다.
  • 9종 프리미엄 음색 중에서 성별·연령·언어·방언 조합을 골라 스타일을 제어하는 CustomVoice 전용 태스크에 특화됐다.

제한사항

  • CustomVoice는 사전 정의된 9종 프리미엄 음색 중에서만 선택할 수 있어 완전한 임의 음성 클로닝은 Base 모델의 역할이다.
  • InstructTTSEval 지시-따르기 평가에서 25Hz-1.7B-CustomVoice보다 낮은 항목이 있다(영어 DSD 77.1 대 82.8, RP 63.7 대 69.3).

벤치마크

벤치마크지표비교
end-to-end 합성 지연latency97ms

1.8k

LIKES

2.5M

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.