100+언어와 제로샷 보이스 클로닝을 지원하는 Higgs TTS v3
8개 코드북 멀티코드 토크나이저와 4B autoregressive decoder로 제로샷 보이스 클로닝·감정·스타일·프로소디 제어를 제공하는 다국어 TTS이다.
TL;DR
Higgs TTS v3는 텍스트와 오디오 토큰을 교차 입력으로 처리하는 autoregressive TTS로, 8개의 코드북과 지연(delay) 패턴을 사용하는 Higgs Tokenizer를 기반으로 한다. 모델은 multi-codebook fused embedding/head를 통해 텍스트 임베딩과 오디오 코드 표현을 정합시키며, 약 4B 크기의 autoregressive decoder(36L, hidden=2560, GQA 32/8)와 8,192 토큰 컨텍스트 길이로 멀티턴·대화형 합성을 지원한다. 모델은 100개 이상 언어를 지원하며 102개 언어에서 단일자리 WER/CER을 보고했고 그중 85개 언어는 WER/CER < 5로 분류되어 높은 다국어 정확도를 보인다. 제로샷 보이스 클로닝을 지원하며 <|emotion:…|>, <|style:…|>, <|prosody:…|>, <|sfx:…|> 같은 인라인 제어 토큰으로 감정·스타일·속도·피치·효과를 세밀하게 조절할 수 있다. 실시간성 측면에서는 SGLang-Omni·vLLM-Omni 같은 서빙 스택과 H100(bf16, CUDA Graph) 환경에서 RTF<1과 서브초 time-to-first-audio 스트리밍을 달성한 벤치마크가 제시된다. 연구·비상업용 라이선스로 배포되며 상업적 배포나 호스팅은 별도 라이선스가 필요하다. 아키텍처는 오디오 표현력을 높이는 대신 multi-codebook 디코딩과 서빙 구현에서 연산 및 인프라 복잡도가 증가하는 트레이드오프가 존재한다. 재현 가능한 서빙 레퍼런스와 벤치마크 스크립트가 제공되어 성능 검증과 통합 구현이 가능하다.
핵심 역량
- 제로샷 보이스 클로닝: 참조 오디오(및 선택적 텍스트)를 사용해 목소리 특성을 재현한다
- 다국어 TTS: 100개 이상의 언어에 대해 단일 모델로 합성 가능하며 다수 언어에서 단일자리 WER/CER 성능을 달성했다
- 정서·스타일·프로소디 제어: <|emotion:…|>, <|style:…|>, <|prosody:…|> 등의 토큰으로 말투·속도·피치·표정 제어가 가능하다
- 사운드 이펙트 삽입: <|sfx:…|> 토큰과 온오마토페이아 페어링으로 기침·웃음 등 효과를 삽입한다
- 스트리밍·저지연 서빙: SSE 기반 스트리밍과 CUDA Graph·bf16 조합으로 서브초 단위 time-to-first-audio와 RTF<1 성능을 지원한다
- 멀티턴 대화/혼합 입력: 텍스트 토큰과 오디오 토큰을 교차로 입력해 대화형 음성 합성 흐름을 유지한다
강점
- 광범위한 다국어 성능: README는 102개 언어에 대해 단일자리(WER/CER) 성능을 보고하며 그중 85개 언어는 WER/CER < 5로 '정교한(production-quality)' 범주에 포함된다.
- 정량적 우위: 공개된 벤치마크 표에서 SeedTTS, CV3, MiniMax-Multilingual, Higgs-Multilingual 등의 행에서 Higgs TTS v3가 가장 낮은 WER/CER(예: SeedTTS 1.11, MiniMax 2.74, Higgs-Multilingual 3.61)을 기록해 동급 모델 대비 음성 정확도 우위를 보였다.
- 표현·대화 능력: Emergent TTS 판정에서 전반적 승률 53.65%와 paralinguistics 68.57%, 질문형 61.43% 등 여러 항목에서 높은 선호도를 기록해 정서·비언어적 표현 처리에서 강점이 있다.
훈련 방식
백본은 약 4B 크기의 autoregressive decoder(36층, hidden=2560, GQA 32/8)이며, Higgs Tokenizer의 8개 코드북(25fps)으로 인코딩한 오디오와 텍스트를 교차한 시퀀스를 예측하도록 학습해 텍스트·오디오 토큰의 공동 생성 능력을 확보했다.
알아두면 좋은 것
- 모델은 연구·비상업용 라이선스로 제공되며 상업적 사용·호스팅 API·수익 목적 사용은 별도 상업 라이선스가 필요하고 특정 악용 사례(무단 성대복제·사칭 등)가 금지되어 있다.
- 아키텍처는 Higgs Tokenizer로 오디오를 8개 코드북(각 1026 vocab, 25 fps)으로 토크나이즈하고 지연 패턴으로 배치해, multi-codebook fused embedding/head와 ~4B autoregressive decoder(36L, hidden=2560, GQA 32/8)가 토큰을 생성한다.
- 제어 토큰은 문장 선두에 배치되는 delivery 토큰(감정·스타일·속도 등)과 인라인으로 배치되는 위치 토큰(일시정지·효과 등) 규칙을 갖고 있으며, prosody 토큰은 속도·피치 수치 효과(예: ≈0.65×, ≈+2.5 semitones)를 명시한다.
- 실험적 재현성을 위해 SGLang-Omni·vLLM-Omni 같은 서빙 스택과 벤치마크 스크립트를 제공하며, H100(bf16, CUDA Graph)에서 동시성별 RTF와 처리량 수치를 제시한다.
기술적 특징
- 멀티 코드북 토크나이저와 지연 패턴: 오디오를 8개의 코드북(각 1026 vocab, 25fps)으로 분해하고 코드북 출력을 staggered delay로 배치해 시계열 정보를 분산시킨다. 이 구조는 단일 코드 스트림보다 더 높은 음향 해상도를 제공하고, 디코더가 시간 정보를 재구성할 때 더 세밀한 음향 표현을 가능하게 한다.
- multi-codebook fused embedding / head와 텍스트 임베딩 연계: 8개 코드북을 단일 텐서로 융합해 embedding과 head에서 처리하며, 텍스트 임베딩과 묶음(tied) 구조를 사용해 텍스트-오디오 표현 간 정합을 유지한다. 이 설계는 음성합성과 텍스트 간 일관된 표현 학습을 지원한다.
- 4B autoregressive decoder + GQA로 균형 잡힌 성능·효율: 백본은 36층, hidden=2560, GQA 32/8 설정을 사용해 대용량 컨텍스트(8,192 tokens)와 autoregressive 생성의 표현력을 확보하면서도 어텐션 효율을 개선했다. 긴 컨텍스트는 멀티턴·대화형 음성 합성 시 과거 문맥 유지에 유리하다.
- 인라인 제어 토큰과 세부 규칙으로 세밀한 표현 제어: 감정·스타일·프로소디 토큰은 문장 선두에 배치해 전체 턴 특성을 설정하고, pause·sfx 등은 인라인으로 위치시키도록 규정해 정확한 타이밍·표현 제어를 가능하게 했다. prosody 토큰에는 속도·피치의 수치적 효과(예: ≈0.65×, ≈+2.5 semitones)가 명시되어 있어 재현성이 높다.
- 스트리밍·저지연 운영을 고려한 서빙 통합: SGLang-Omni와 vLLM-Omni와의 연계를 통해 continuous batching, CUDA Graph, bf16 등을 사용한 서버 구현을 제시했고, H100 기준 RTF<1과 서브초 time-to-first-audio 스트리밍을 달성해 실시간 대화형 사용 사례에 적합하다.
차별점
- 8개 코드북과 delay 패턴을 결합한 multi-codebook 토크나이저 설계로 음향 해상도와 시간 정보 보존에 중점
- multi-codebook fused single-tensor embedding/head를 텍스트 임베딩과 묶어 텍스트-오디오 정합성을 확보
- 풍부한 인라인 제어 토큰 세트(감정·스타일·프로소디·sfx)와 명확한 배치 규칙으로 턴 단위·인라인 단위 제어를 모두 지원
- SGLang-Omni·vLLM-Omni와 통합된 서빙 레퍼런스 및 벤치마크로 재현 가능한 저지연 스트리밍 운영을 제시
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| SeedTTS | WER/CER (×100, lower better) | 1.11 | 해당 행에서 최저치(표에서 bold) |
| CV3 | WER/CER (×100, lower better) | 4.41 | 해당 행에서 최저치(표에서 bold) |
| MiniMax-Multilingual | WER/CER (×100, lower better) | 2.74 | 해당 행에서 최저치(표에서 bold) |
| Higgs-Multilingual | WER/CER (×100, lower better) | 3.61 | 해당 행에서 최저치(표에서 bold) |
| Emergent TTS (Overall win-rate) | Win-rate (↑, judge preference) | 53.65% | — |
이미지 분석

512
Likes
78.7k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.