IndexTeam/IndexTTS-2.5
단일 참조 음성으로 여러 언어의 음성을 합성하고 화자 음색과 감정을 제어하는 text-to-speech약 0.8B (GPT backbone)bilibili Model Use License Agreement
한 음성으로 5개 언어와 감정·속도를 제어하는 zero-shot TTS
학습 방식 · GPT backbone 기반 autoregressive TTS가 flow-matching speech-to-mel decoder와 BigVGAN vocoder를 연결해 참조 음성의 음색을 유지한 파형을 생성합니다.
TL;DR
IndexTTS-2.5는 특정 단일 모델을 미세조정한 파생형이 아니라 약 0.8B GPT backbone, flow-matching speech-to-mel decoder, BigVGAN vocoder로 구성한 autoregressive zero-shot TTS 모델입니다. 참조 음성 한 개에서 화자 음색을 추출한 뒤 중국어·영어·일본어·스페인어·아랍어 텍스트를 합성하며, 언어가 바뀌어도 음색을 옮기는 cross-lingual voice cloning을 지원합니다. 8개 감정 벡터, Pinyin·CMU phoneme·Kana 발음 표기, 0.5–2.0 범위의 duration_factor를 입력해 감정·발음·속도를 제어할 수 있습니다. IndexTTS-2보다 일본어·스페인어·아랍어를 추가하고 inference 속도와 발음 제어를 개선했으며, 추론에는 NVIDIA GPU와 약 6 GB VRAM이 필요합니다.
핵심 포인트
- 단일 참조 음성만으로 화자 음색을 복제하는 zero-shot TTS 모델입니다.
- 중국어·영어·일본어·스페인어·아랍어 사이에서 음색을 유지한 cross-lingual 합성을 지원합니다.
- 8개 감정값과 duration_factor로 감정 강도와 말하기 속도를 직접 조절합니다.
- Pinyin·CMU phoneme·Kana 표기를 입력해 중국어·영어·일본어 발음을 세밀하게 지정합니다.
제한사항
- 긴 텍스트는 여러 구간으로 나뉘어 생성된 뒤 짧은 무음과 함께 이어지므로 구간 경계에서 전체 문맥의 prosody가 연결되지 않습니다. 텍스트를 분할하는 과정에서 구간 사이 억양과 리듬을 공동으로 모델링하지 않기 때문에 긴 발화의 자연스러움이 제한될 수 있습니다. 긴 문장을 한 번에 처리하는 용도보다 구간별 합성 결과를 점검할 수 있는 파이프라인에 적합합니다.
- 텍스트 설명 기반 감정 제어에는 IndexTTS2를 use_qwen_emo=True로 생성하고 QwenEmotion 모델을 함께 불러와야 합니다. 이 설정 없이 use_emo_text=True를 전달하면 inference 단계에서 오류가 발생합니다. use_random=True로 감정 샘플링을 활성화하면 voice cloning의 화자 유사도가 낮아집니다.
72
Likes
702
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.