MoE로 저지연 고품질 음성 합성을 노린 대규모 TTS
ZONOS2는 MoE 백본과 ECAPA‑TDNN 화자 임베딩을 사용해 6백만 시간 이상의 다국어 음성 데이터로 학습된 고정밀 음성 합성·화자 클로닝 모델이다.
TL;DR
ZONOS2는 Zyphra가 공개한 대규모 text‑to‑speech 모델로, 6백만 시간 이상의 다국어 음성 데이터로 학습되었으며 MoE 백본과 ECAPA‑TDNN 화자 임베딩을 사용해 고품질 음성 합성과 화자 클로닝을 목표로 한다. 텍스트 입력은 nemo TN(정규화된 UTF‑8 바이트)로 토크나이즈되고, 모델은 DAC 토큰을 예측해 역변환기로 오디오를 복원하는 토큰 기반 파이프라인을 사용한다. README는 MoE를 통해 저지연 추론을 달성했다고 언급하며, English·Mandarin·Japanese를 우선 지원하는 Tier 구조와 다수의 tier2/3 언어 목록을 제공한다. 배포 측면에서는 Mini‑SGLang 기반의 로컬 고성능 TTS 서버와 오프라인 Python API를 제공하며, 실행은 Linux(x86_64)와 NVIDIA GPU·CUDA 환경을 전제로 한다 — 모델 샘플 청취용 클라우드 서비스도 제공되지만 README에는 외부 벤치마크 수치가 없어 성능 비교는 공개 주장 수준에 한정된다.
핵심 역량
- 텍스트로부터 고충실도(hi‑fidelity) 음성 합성 수행, 스트리밍 출력 지원
- ECAPA‑TDNN 기반 화자 임베딩으로 특정 화자 성향을 재현하는 voice cloning
- 다국어 합성(언어별 Tier 표에 따른 언어 범위 제공)
- 오프라인 Python API와 로컬 Mini‑SGLang 기반 고성능 TTS 서버로 배치·스트리밍 생성 지원
- UTF‑8 바이트 정규화(nemo TN) 입력 파이프라인을 통한 비표준 문자·다국어 토크나이제이션 처리
강점
- README에 따르면 6백만 시간 이상의 다양한 다국어 음성을 사용해 학습되어 데이터 규모 측면의 강점을 갖는다.
- MoE 아키텍처를 도입해 저지연(low latency) 추론을 목표로 하며 README에서 'top TTS providers와 동등하거나 능가'한다고 주장한다.
- Apache‑2.0 라이선스를 사용해 상업적·비상업적 용도로 사용 가능한 점이 명시되어 있다.
훈련 방식
MoE 백본을 사용해 6백만 시간 이상(multilingual speech)으로 학습했으며, ECAPA‑TDNN 화자 임베딩과 nemo TN(정규화된 UTF‑8 바이트)을 텍스트/화자 조건으로 사용해 DAC 토큰을 생성하도록 학습되었다.
알아두면 좋은 것
- 학습 데이터: 6백만 시간 이상(multilingual speech)으로 학습되었다는 문구가 README에 존재한다.
- 로컬 실행 제약: Linux(x86_64)에서 NVIDIA GPU와 CUDA 호환 드라이버가 필요하다고 명시되어 있다.
- 서빙: Mini‑SGLang 기반 고성능 TTS 추론 서버를 로컬에서 제공하며 기본 음성 저장·스캔 기능을 갖춘다.
- 호스팅 옵션: Zyphra가 제공하는 클라우드 음성 플레이그라운드(샘플 청취) 링크가 포함되어 있다.
기술적 특징
- MoE 백본을 사용해 입력에 따라 일부 전문가(expert)만 활성화함으로써 연산 효율과 모델 표현력을 동시에 확보하려는 구조를 채택했다. README는 이를 저지연 추론과 고품질 합성의 핵심 설계 선택으로 제시한다.
- 텍스트 입력은 nemo TN으로 정규화된 UTF‑8 바이트 단위로 토크나이즈해 다국어 및 비표준 문자 처리를 단순화한다. 바이트 수준 토크나이제이션은 언어별 사전 불일치 문제를 줄여 다언어 지원 범위를 넓히는 역할을 한다.
- 화자 재현은 ECAPA‑TDNN 임베딩을 사용해 수행되며, 로컬 'default_voices' 디렉토리에서 WAV/MP3 등의 오디오 파일을 스캔해 임베딩을 재사용하도록 설계되었다. 이 워크플로는 빠른 화자 클로닝과 반복 실험을 지원한다.
- 오디오 합성은 DAC 토큰 생성-디코딩 파이프라인을 사용해 토큰화된 오디오 표현을 생성하고 역변환기로 실제 오디오 신호를 복원한다. DAC 토큰 기반 파이프라인은 생성 모델과 오디오 합성 사이의 인터페이스를 분리해 모델 설계·튜닝 유연성을 제공한다.
- 추론 성능 최적화를 위해 Mini‑SGLang 기반 고성능 TTS 서버를 제공하며, 로컬 서버는 스트리밍 출력과 배치 요청을 모두 처리하도록 구성되어 있다. 서버 실행 시 NVIDIA GPU와 CUDA 호환 드라이버 요구 조건이 명확히 제시되어 있다.
차별점
- MoE 백본과 DAC 토큰 기반 파이프라인 결합으로 저지연·고품질 합성을 목표로 설계되었다.
- ECAPA‑TDNN 화자 임베딩을 활용한 간단한 로컬 음성 스캔/저장 워크플로를 통해 화자 클로닝을 손쉽게 수행하도록 지원한다.
- 오픈 소스 Mini‑SGLang 서버와 함께 로컬 고성능 추론 환경 제공(단, Linux + NVIDIA 전용).
- 학습 데이터 규모(README 기준 6백만 시간 이상)를 전면에 내세워 대규모 다국어 커버리지를 강조한다.
이미지 분석

119
Likes
813
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.