본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

Zyphra/ZONOS2

텍스트 입력을 받아 DAC 토큰을 생성하고 역변환을 통해 고품질 음성(스트리밍·배치) 합성을 수행하는 text‑to‑speech(음성 합성) 작업apache-2.0

ZONOS2는 MoE 백본과 ECAPA‑TDNN 화자 임베딩을 사용해 6백만 시간 이상의 다국어 음성 데이터로 학습된 고정밀 음성 합성·화자 클로닝 모델이다.

학습 방식 · MoE 백본을 사용해 6백만 시간 이상(multilingual speech)으로 학습했으며, ECAPA‑TDNN 화자 임베딩과 nemo TN(정규화된 UTF‑8 바이트)을 텍스트/화자 조건으로 사용해 DAC 토큰을 생성하도록 학습되었다.

TL;DR

ZONOS2는 Zyphra가 공개한 대규모 text‑to‑speech 모델로, 6백만 시간 이상의 다국어 음성 데이터로 학습되었으며 MoE 백본과 ECAPA‑TDNN 화자 임베딩을 사용해 고품질 음성 합성과 화자 클로닝을 목표로 한다. 텍스트 입력은 nemo TN(정규화된 UTF‑8 바이트)로 토크나이즈되고, 모델은 DAC 토큰을 예측해 역변환기로 오디오를 복원하는 토큰 기반 파이프라인을 사용한다. README는 MoE를 통해 저지연 추론을 달성했다고 언급하며, English·Mandarin·Japanese를 우선 지원하는 Tier 구조와 다수의 tier2/3 언어 목록을 제공한다. 배포 측면에서는 Mini‑SGLang 기반의 로컬 고성능 TTS 서버와 오프라인 Python API를 제공하며, 실행은 Linux(x86_64)와 NVIDIA GPU·CUDA 환경을 전제로 한다 — 모델 샘플 청취용 클라우드 서비스도 제공되지만 README에는 외부 벤치마크 수치가 없어 성능 비교는 공개 주장 수준에 한정된다.

핵심 포인트

  • MoE 백본과 DAC 토큰 기반 파이프라인 결합으로 저지연·고품질 합성을 목표로 설계되었다.
  • ECAPA‑TDNN 화자 임베딩을 활용한 간단한 로컬 음성 스캔/저장 워크플로를 통해 화자 클로닝을 손쉽게 수행하도록 지원한다.
  • 오픈 소스 Mini‑SGLang 서버와 함께 로컬 고성능 추론 환경 제공(단, Linux + NVIDIA 전용).
  • 학습 데이터 규모(README 기준 6백만 시간 이상)를 전면에 내세워 대규모 다국어 커버리지를 강조한다.

이미지 분석

모델 아키텍처 및 추론 파이프라인 다이어그램으로, Speaker Pipeline, Text Pipeline, ZONOS2 MoE 블록, DAC 토크나이저/디코더, 'Revert Delay Pattern' 등 구성 요소가 시각화되어 있다.
이미지에서 텍스트 토큰화(UTF‑8 bytes, Text Norm), 화자 파이프라인(Reference Audio → ECAPA‑TDNN → Projection), ZONOS2 MoE 블록(여러 expert 슬롯), 그리고 DAC 오디오 컨텍스트와 디코더로 이어지는 토큰 예측 흐름이 확인된다. 색상 범례(스피커 임베딩·품질 토큰·말하기 속도 토큰 등)가 포함되어 있어 입력 조건들이 어떻게 결합되어 Generation Conditioning을 형성하는지 직관적으로 파악된다. 다이어그램은 모델이 텍스트·화자 임베딩·추가 조건을 받은 뒤 MoE 층을 통해 DAC 토큰을 예측하고, 역변환 단계에서 오디오를 복원하는 파이프라인을 명확히 보여준다.

119

LIKES

813

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.