0.6B 다국어 제로샷 보이스 클로닝 TTS
DualAR과 번들 코덱을 갖춘 0.6B 규모의 다국어 TTS 체크포인트
TL;DR
Audio8 TTS Preview는 약 0.6B 파라미터의 컴팩트한 다국어 TTS 체크포인트로, DualAR 구조와 번들형 44.1 kHz neural codec을 결합해 참조 오디오 기반의 제로샷 보이스 클로닝을 지원한다. 느린 AR은 프레임당 의미 토큰을, 빠른 AR은 10개의 코드북 인덱스를 예측해 고해상도 파형을 복원하며 최대 2,048 포지션의 텍스트·오디오 컨텍스트를 처리한다. Seed-TTS와 CV3 벤치마크에서 파라미터 대비 상위권 성능을 보이며 특히 영어 WER 1.506으로 매우 낮은 오류율을 기록한 점이 특징이다. 배포를 위해서는 repository의 커스텀 Transformers 코드를 trust_remote_code=True로 불러야 하고 참조 오디오에는 정확한 전사가 필요하다. Preview 상태로 언어 커버리지는 제한적이므로 생산 환경 적용 전 추가 평가와 법적·윤리적 검토가 권장된다.
핵심 역량
- 제로샷 보이스 클로닝을 통한 화자 전이
- 11개 추천 언어(광동어·중국어·네덜란드어·영어 등)의 다국어 TTS 생성
- 44.1 kHz 네이티브 샘플레이트를 갖춘 번들형 neural codec으로 즉시 인코딩·디코딩 가능
- DualAR 구조로 의미 토큰과 코드북 토큰을 분리해 컴팩트한 파라미터로 고품질 합성
- 최대 2,048 포지션의 텍스트/오디오 컨텍스트를 처리
강점
- 0.6B라는 소형 모델 크기에서 Seed-TTS의 영어 WER 1.506으로 최저치를 기록해 파라미터 대비 효율성이 높다
- 번들된 44.1 kHz neural codec으로 별도 코덱 체크포인트 없이 참조 인코딩과 파형 복원이 가능해 배포가 간편하다
- 제로샷 보이스 클로닝을 지원해 단일 참조 샘플로 화자 유사도를 전이할 수 있으며 다국어 환경에서 경쟁력 있는 CER/WER 성능을 보인다
훈련 방식
레포지토리에서는 DualAR 아키텍처 기반의 자기회귀(autoregressive) 모델 구성을 명시하며 느린 AR 변환기는 프레임당 의미적(semantic) 토큰을 예측하고 빠른 AR 변환기는 해당 프레임의 코드북(codebook) 인덱스를 이전 코드북과 느린 상태(hidden state)에 조건화해 예측한다. 코덱이 모델 패키지에 번들되어 있어 참조 오디오를 직접 인코딩하고 디코딩하는 워크플로우가 통합되어 있으며, 문맥으로 텍스트와 참조 오디오·전사를 함께 패킹해 최대 2,048 포지션까지 처리한다. 공개된 문서에서는 별도의 RL/정교한 SFT 절차는 언급하지 않으며 아키텍처와 평가 파이프라인 중심의 기술적 설명이 제공되어 있다.
알아두면 좋은 것
- 전체 체크포인트와 44.1 kHz 신경망 코덱, 토크나이저·프로세서 및 Hugging Face 원격 코드 포함
- Preview 상태로 언어 범위가 제한되며 최적 결과는 11개 추천 언어 사용 시 기대됨
- 사용 시 Transformers의 trust_remote_code=True 옵션을 사용해야 하는 커스텀 코드베이스
- Seed-TTS와 CV3 벤치마크에서 파라미터 대비 상위권 성능을 보이며 영어 WER에서 최저치를 기록
기술적 특징
- 메인 모델은 약 601M 파라미터이며 느린 AR은 24개 레이어, 너비 896, 어텐션 헤드 14, 2 KV 헤드를 사용해 프레임 단위 의미 토큰을 예측한다.
- 빠른 AR은 4개 레이어, 너비 896, 어텐션 헤드 14, 2 KV 헤드를 사용해 10개의 acoustic codebook(각 4,096 엔트리)을 조건화해 코드북 인덱스를 생성한다.
- 코덱 설정은 44.1 kHz 샘플레이트에 프레임당 2,048 샘플(약 21.5 프레임/s)로 설계되어 고해상도 오디오 복원이 가능하며 인코더·디코더가 모델 패키지에 포함된다.
- 입력 처리 파이프라인은 텍스트와 참조 오디오·참조 전사를 함께 패킹해 모델에 전달하며 모델 API는 trust_remote_code=True로 커스텀 로직을 로드하도록 설계되어 있다.
차별점
- 동급 SOTA와 비교해 파라미터 수를 크게 줄이면서도 Seed-TTS와 CV3에서 상위권 성능을 달성한 점
- 코덱을 번들로 포함해 별도 오디오 코덱 의존성을 제거한 통합 패키지 제공
- 제로샷 보이스 클로닝 워크플로우가 README와 예제 코드로 명확히 제시되어 빠른 프로토타이핑에 적합함
- Fish Audio S2 Pro에서 영감을 받은 DualAR 설계로 의미와 음향 토큰을 분리하여 모델 효율을 극대화함
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Seed-TTS | EN WER / SIM | 1.506 / 63.2 | Fish S2 Pro(4.6B) EN WER 1.607, Audio8가 더 낮음 |
| Seed-TTS | ZH CER / SIM | 0.950 / 73.1 | Higgs Audio v2(4.7B) ZH CER 0.806이 더 낮음 |
| CV3 multilingual error rate | 다국어 평균 오류율(예시 언어) | zh 3.205 / en 3.128 (표에 제시된 수치) | Fish S2 Pro(4.6B) 대비 zh·en에서 소폭 우세한 항목 존재 |
123
Likes
225
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.