Zyphra/ZONOS2
ZONOS2는 MoE 백본과 ECAPA‑TDNN 화자 임베딩을 사용해 6백만 시간 이상의 다국어 음성 데이터로 학습된 고정밀 음성 합성·화자 클로닝 모델이다.
학습 방식 · MoE 백본을 사용해 6백만 시간 이상(multilingual speech)으로 학습했으며, ECAPA‑TDNN 화자 임베딩과 nemo TN(정규화된 UTF‑8 바이트)을 텍스트/화자 조건으로 사용해 DAC 토큰을 생성하도록 학습되었다.
TL;DR
ZONOS2는 Zyphra가 공개한 대규모 text‑to‑speech 모델로, 6백만 시간 이상의 다국어 음성 데이터로 학습되었으며 MoE 백본과 ECAPA‑TDNN 화자 임베딩을 사용해 고품질 음성 합성과 화자 클로닝을 목표로 한다. 텍스트 입력은 nemo TN(정규화된 UTF‑8 바이트)로 토크나이즈되고, 모델은 DAC 토큰을 예측해 역변환기로 오디오를 복원하는 토큰 기반 파이프라인을 사용한다. README는 MoE를 통해 저지연 추론을 달성했다고 언급하며, English·Mandarin·Japanese를 우선 지원하는 Tier 구조와 다수의 tier2/3 언어 목록을 제공한다. 배포 측면에서는 Mini‑SGLang 기반의 로컬 고성능 TTS 서버와 오프라인 Python API를 제공하며, 실행은 Linux(x86_64)와 NVIDIA GPU·CUDA 환경을 전제로 한다 — 모델 샘플 청취용 클라우드 서비스도 제공되지만 README에는 외부 벤치마크 수치가 없어 성능 비교는 공개 주장 수준에 한정된다.
핵심 포인트
- MoE 백본과 DAC 토큰 기반 파이프라인 결합으로 저지연·고품질 합성을 목표로 설계되었다.
- ECAPA‑TDNN 화자 임베딩을 활용한 간단한 로컬 음성 스캔/저장 워크플로를 통해 화자 클로닝을 손쉽게 수행하도록 지원한다.
- 오픈 소스 Mini‑SGLang 서버와 함께 로컬 고성능 추론 환경 제공(단, Linux + NVIDIA 전용).
- 학습 데이터 규모(README 기준 6백만 시간 이상)를 전면에 내세워 대규모 다국어 커버리지를 강조한다.
이미지 분석

119
LIKES
813
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.