bosonai/higgs-tts-3-4b
이 모델은 텍스트-투-스피치(text-to-speech)와 보이스 클로닝을 주된 태스크로 수행한다. 입력 텍스트에 inline control token을 삽입하면 감정, 스타일, 속도, 음향 효과 등을 토큰 단위로 제어하여 출력 음성을 조작할 수 있다. 스트리밍 및 배치 서빙 환경에서 실시간성 수치(RTF)와 처리량(throughput)을 측정하여 배포 성능 평가까지 고려한 디자인을 채택했다.~4B8K 컨텍스트boson-higgs-audio-v3-research-and-non-commercial-license
Higgs TTS 3는 4B autoregressive decoder와 8개 코드북 토크나이저를 결합해 100개 이상의 언어에서 제어 가능한 대화형 음성 합성과 제로샷 보이스 클로닝을 제공한다.
TL;DR
Higgs TTS 3는 Boson AI가 공개한 약 4B 규모의 autoregressive text-to-speech 모델로, 8개의 코드북을 쓰는 Higgs Tokenizer와 multi-codebook fused embedding/head를 결합해 텍스트와 오디오 토큰을 교차 처리하는 설계를 채택했다. 이 구조는 25fps 프레임 단위의 오디오 코드화를 백본에 주입하고, 디코딩 시 지연을 해소하여 파형으로 복원하는 방식으로 작동하며 README 기준으로 102개 언어에서 단일 자릿수 WER/CER 성능을 보였다. 감정·스타일·prosody·sfx를 inline 토큰으로 제어할 수 있어 대화형·표현적 음성 합성이 가능하고, SGLang-Omni·vLLM-Omni 연동과 H100 벤치마크(RTF 0.147, throughput 1.62 req/s 등)를 통해 배포 성능도 제시되었다. 라이선스는 연구·비상업적 용도로 제한되어 상업적 사용은 별도 라이선스가 필요하다.
핵심 포인트
- multi-codebook 토크나이저와 delay pattern을 결합한 토큰화·디코딩 파이프라인으로 코드북 기반 오디오 표현을 autoregressive 시퀀스와 직접 결합한 점.
- 감정·스타일·prosody·sfx를 모두 inline 토큰으로 제어할 수 있도록 문법과 위치 규칙을 문서화하여 제어 가능성이 높은 합성 인터페이스를 제공한 점.
- H100 기준 재현 가능한 throughput·RTF 표와 인간 판정 기반 win-rate 표 등으로 배치 및 실시간 서빙 성능, 음성 품질 우위를 함께 제시한 점.
- 다국어 성능에서 강점이 있어 README 기준으로 102개 언어에 대해 단일 자릿수 WER/CER을 달성한 점이 명시되어 있어 광범위한 언어 커버리지가 강점이다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SeedTTS | WER/CER (↓, ×100) | 1.11 | — |
| CV3 | WER/CER (↓, ×100) | 4.41 | — |
| MiniMax-Multilingual | WER/CER (↓, ×100) | 2.74 | — |
| Higgs-Multilingual | WER/CER (↓, ×100) | 3.61 | — |
| Emergent TTS Overall | Win-rate (↑) | 53.65% | — |
이미지 분석

581
LIKES
103.9k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.