본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

BreezeBlue/Breeze-TTS-2

영어와 중국어 텍스트를 자연스러운 음성으로 변환하며 Voice Clone, Voice Design, Voice Direction을 지원하는 text-to-speech입니다.BreezeBlue Research and Non-Commercial License

자연어 음성 설계와 초저지연 스트리밍을 결합한 영어·중국어 TTS 모델

TL;DR

Breeze TTS 2는 특정 base model이나 Fine-tuning 계보를 README에서 밝히지 않은 open-weight text-to-speech 모델로, 영어와 중국어 음성을 실시간 생성합니다. 참조 음성과 정확한 전사문을 입력하면 화자의 음색·리듬·감정·스타일을 복제하고, 자연어 instruction만으로 참조 음성 없는 Voice Design도 수행합니다. 참조 음성에 instruction을 더하면 화자 정체성을 유지한 채 감정·속도·전달 방식을 조절하는 Voice Direction이 작동하며, 텍스트 안의 Vocal Events로 웃음이나 한숨도 지정합니다. 워밍업된 NVIDIA H100 fast path에서 TTFA 40 ms 미만과 RTF 0.32를 기록했고, Eager inference는 약 7.7 GiB GPU 메모리를 사용합니다.

핵심 포인트

  • 참조 음성과 정확한 전사문으로 화자의 음색·리듬·감정·스타일을 보존합니다.
  • 자연어 설명만으로 참조 음성 없이 원하는 특성의 목소리를 생성합니다.
  • 참조 화자의 정체성을 유지하면서 음색·감정·속도·전달 방식을 조절합니다.
  • 텍스트 안에 (laugh)나 [笑] 같은 Vocal Events를 넣어 표현을 제어합니다.

제한사항

  • Linux와 Python 3.10 이상, CUDA를 지원하는 NVIDIA GPU가 필요합니다. Eager inference에는 약 7.7 GiB GPU 메모리가 필요하며 12 GB GPU가 최소 권장 구성입니다. --fast-all을 사용하면 약 14.4 GiB가 필요해 24 GB GPU 구성이 권장됩니다.
  • Voice Clone과 Voice Direction은 깨끗한 참조 음성과 정확한 전사문을 함께 요구합니다. 참조 음성은 배경 소음이 최소화된 음성이어야 합니다. 제공된 모델 가중치와 파생 모델, self-hosted 출력은 연구 및 비상업적 용도로만 사용할 수 있습니다.
  • Streaming API는 기본적으로 단일 동시 요청을 처리합니다. 실시간 성능을 높이는 fast path는 CUDA Graph와 StaticCache 기반 단계별 최적화를 사용하지만 cold-start 시간이 늘어날 수 있습니다. README에는 다중 동시 요청 처리 구성이 제시되지 않았습니다.

벤치마크

벤치마크지표비교
Artificial Analysis TTS leaderboardopen-weight 모델 순위#1README 공개 주장 기준으로 frontier proprietary systems보다 높은 성능
Time to First AudioTTFA40 ms 미만워밍업된 fast path와 NVIDIA H100 기준
Real-Time FactorRTF0.32워밍업된 fast path와 NVIDIA H100 기준, 약 3.1배 실시간 생성

84

LIKES

51

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.