Audio8/Audio8-TTS-Preview-0.1b
다국어 텍스트를 음성으로 합성하고 참조 음성 없이도 화자 목소리를 복제하는 zero-shot TTS입니다.메인 모델 약 170M, codec decoder 약 120M2K 컨텍스트audio8-community-license-v1.0
약 170M 모델로 다국어 음성 합성과 zero-shot voice cloning을 수행하는 compact TTS checkpoint입니다.
TL;DR
Audio8 TTS Preview 0.1B는 Audio8 Falcon H1 구조를 사용하는 약 170M 파라미터 규모의 compact preview TTS checkpoint이며, 별도 화자 학습 없이 참조 음성과 transcript로 zero-shot voice cloning을 수행합니다. slow AR이 semantic token을 예측하고 fast AR이 이를 조건으로 10개 codec codebook을 생성한 뒤, 별도 약 120M 파라미터 codec decoder가 44.1 kHz 음성으로 복원합니다. 중국어와 영어를 주요 언어로 삼고 독일어·스페인어·프랑스어·이탈리아어·일본어·한국어를 실험적으로 지원하지만, README의 CV3·Seed-TTS 수치는 다른 모델 보고서와 평가 조건이 섞인 참조 비교입니다. 작은 생성 모델과 번들 codec으로 음성 합성 및 voice cloning의 실행 규모를 줄였지만, 참조 음성 품질과 언어별 결과 편차를 배포 전에 확인해야 합니다.
핵심 포인트
- 약 170M 파라미터의 생성 모델과 약 120M 파라미터의 codec decoder로 구성됩니다. 전체 음성 생성 스택을 작은 규모로 묶어 zero-shot TTS 실행 부담을 낮춥니다. 중국어와 영어를 주 대상으로 하며 나머지 언어는 실험적 지원 범위입니다.
- Audio8 Falcon H1 구조에서 slow AR이 semantic token을 만들고 fast AR이 codec codebook을 생성합니다. fast AR은 slow branch의 hidden state를 조건으로 사용해 텍스트에서 음향 토큰으로 이어지는 생성을 분리합니다. 10개 codebook과 4,096개 항목을 사용해 음성 표현을 구성합니다.
- 참조 음성과 정확한 transcript를 입력하면 별도 화자 학습 없이 voice cloning을 수행합니다. Processor가 텍스트·참조 음성·참조 문장을 묶고 generate가 코드를 만든 뒤 codec decoder가 44.1 kHz waveform으로 복원합니다. 참조 음성과 문장이 길거나 시끄럽거나 서로 맞지 않으면 안정성과 화자 유사도가 낮아질 수 있습니다.
제한사항
- 중국어와 영어가 주요 목표 언어이며 독일어·스페인어·프랑스어·이탈리아어·일본어·한국어는 품질 편차가 더 큽니다. 모델 규모가 작은 Preview checkpoint라 언어별 음성 품질이 균일하지 않습니다. 다국어 배포 전에는 대상 언어별 정확도와 안정성을 따로 평가해야 합니다.
- 참조 음성의 길이와 품질, transcript 일치 여부가 생성 결과에 직접 영향을 줍니다. 매우 길거나 잡음이 많거나 잘못 전사된 음성은 생성 안정성과 speaker similarity를 낮출 수 있습니다. 따라서 입력 음성과 문장을 정확히 맞춘 뒤 실제 사용 환경에서 검증해야 합니다.
- voice cloning은 사칭과 misinformation에 악용될 수 있습니다. 음성을 복제하기 전에 화자의 동의를 받고 합성 음성임을 적절히 공개해야 합니다. 배포 전에는 정확성·안전성·법적 준수 여부를 점검해야 합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| CV3 | WER/CER, 낮을수록 좋음 | zh 3.619; en 3.307; ja 12.322; ko 7.653; de 5.292; es 8.548; fr 12.349; it 14.480 | Audio8 TTS Preview 0.6B의 평가표를 기준으로 한 참조 비교이며, 엄격하게 동일 조건으로 재평가한 순위가 아님 |
| Seed-TTS | EN WER / SIM | 1.662 / 56.7 | 동일 표의 Audio8 TTS Preview 0.6B는 1.506 / 63.2, Fish S2 Pro는 1.607 / 64.6으로 기재됨 |
| Seed-TTS | ZH CER / SIM | 1.13 / 68.2 | 동일 표의 Audio8 TTS Preview 0.6B는 0.950 / 73.1, Higgs Audio v2는 0.806 / 72.1으로 기재됨 |
117
LIKES
1.1k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.