BreezeBlue/Breeze-TTS-2
영어와 중국어 텍스트를 자연스러운 음성으로 변환하며 Voice Clone, Voice Design, Voice Direction을 지원하는 text-to-speech입니다.BreezeBlue Research and Non-Commercial License
자연어 음성 설계와 초저지연 스트리밍을 결합한 영어·중국어 TTS 모델
TL;DR
Breeze TTS 2는 특정 base model이나 Fine-tuning 계보를 README에서 밝히지 않은 open-weight text-to-speech 모델로, 영어와 중국어 음성을 실시간 생성합니다. 참조 음성과 정확한 전사문을 입력하면 화자의 음색·리듬·감정·스타일을 복제하고, 자연어 instruction만으로 참조 음성 없는 Voice Design도 수행합니다. 참조 음성에 instruction을 더하면 화자 정체성을 유지한 채 감정·속도·전달 방식을 조절하는 Voice Direction이 작동하며, 텍스트 안의 Vocal Events로 웃음이나 한숨도 지정합니다. 워밍업된 NVIDIA H100 fast path에서 TTFA 40 ms 미만과 RTF 0.32를 기록했고, Eager inference는 약 7.7 GiB GPU 메모리를 사용합니다.
핵심 포인트
- 참조 음성과 정확한 전사문으로 화자의 음색·리듬·감정·스타일을 보존합니다.
- 자연어 설명만으로 참조 음성 없이 원하는 특성의 목소리를 생성합니다.
- 참조 화자의 정체성을 유지하면서 음색·감정·속도·전달 방식을 조절합니다.
- 텍스트 안에 (laugh)나 [笑] 같은 Vocal Events를 넣어 표현을 제어합니다.
제한사항
- Linux와 Python 3.10 이상, CUDA를 지원하는 NVIDIA GPU가 필요합니다. Eager inference에는 약 7.7 GiB GPU 메모리가 필요하며 12 GB GPU가 최소 권장 구성입니다. --fast-all을 사용하면 약 14.4 GiB가 필요해 24 GB GPU 구성이 권장됩니다.
- Voice Clone과 Voice Direction은 깨끗한 참조 음성과 정확한 전사문을 함께 요구합니다. 참조 음성은 배경 소음이 최소화된 음성이어야 합니다. 제공된 모델 가중치와 파생 모델, self-hosted 출력은 연구 및 비상업적 용도로만 사용할 수 있습니다.
- Streaming API는 기본적으로 단일 동시 요청을 처리합니다. 실시간 성능을 높이는 fast path는 CUDA Graph와 StaticCache 기반 단계별 최적화를 사용하지만 cold-start 시간이 늘어날 수 있습니다. README에는 다중 동시 요청 처리 구성이 제시되지 않았습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Artificial Analysis TTS leaderboard | open-weight 모델 순위 | #1 | README 공개 주장 기준으로 frontier proprietary systems보다 높은 성능 |
| Time to First Audio | TTFA | 40 ms 미만 | 워밍업된 fast path와 NVIDIA H100 기준 |
| Real-Time Factor | RTF | 0.32 | 워밍업된 fast path와 NVIDIA H100 기준, 약 3.1배 실시간 생성 |
84
LIKES
51
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.