tencent/AuK
Zero-shot TTS, instruction 기반 음성 생성, 음성 콘텐츠·음향·비언어적 특성 편집, 음성 향상과 소스 분리1.5BMIT
자연어 instruction 하나로 TTS·음성 편집·향상·분리를 수행하는 1.5B 음성 기반 모델
학습 방식 · 수백만 시간 규모의 다양한 오디오 데이터로 학습한 1.5B diffusion 기반 foundational model이며, MLLM encoder와 VAE는 별도 파일에서 실행 시 불러옵니다.
TL;DR
AuK는 1.5B 규모의 기반 음성 모델로, 자연어 instruction 하나로 Zero-shot TTS·음성 편집·음성 향상·소스 분리를 처리합니다. 텍스트 조건과 선택적 오디오·참조 음성 조건을 Dual Stream MMDiT와 Single Stream DiT에 결합하고, diffusion 방식으로 음성을 생성합니다. 기본 모델 AuK와 4-step 추론용 증류 모델 AuK-Flash를 제공하며, 음성 생성뿐 아니라 콘텐츠·음향·화자 특성 편집까지 하나의 인터페이스로 묶은 점이 핵심입니다.
핵심 포인트
- 참조 음성 없이 음성 설명만으로 Instruct TTS를 수행하고, 참조 음성을 주면 화자 음색을 반영한 Zero-shot TTS를 생성합니다.
- 텍스트 교체·삽입·삭제, pitch·속도·볼륨 조절, 감정·음색·억양·속삭임 변환을 같은 자연어 instruction으로 처리합니다.
- Dual Stream MMDiT가 텍스트·오디오 조건을 결합한 뒤 Single Stream DiT와 VAE Decoder를 거쳐 생성 음성을 출력합니다.
- AuK-Flash는 AuK를 4-step 추론으로 증류한 변형이며, 저장소에는 고품질 생성용 AuK 기본 가중치가 포함됩니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Seed-TTS-Eval (WER) | WER | 2.65 | 동일 차트의 AuK-Flash: 2.85 |
| Seed-TTS-Eval (SIM) | SIM | 0.795 | 동일 차트의 AuK-Flash: 0.790 |
| InstructTTS-Eval (DSD) | DSD | 82.49 | 동일 차트의 AuK-Flash: 80.60 |
| MMAE-Speech (EMR) | EMR | 13.85 | 동일 차트의 AuK-Flash: 12.44 |
| SpeechEditBench | score | 49.73 | 동일 차트의 AuK-Flash: 46.66 |
| Ming-Freeform-Audio-Edit | score | 88.54 | 동일 차트의 AuK-Flash: 87.55 |
| DNS Challenge | score | 3.35 | 동일 차트의 AuK-Flash: 3.86 |
| CHiME-4 | score | 3.28 | 동일 차트의 AuK-Flash: 3.72 |
| Libri2Mix | score | 3.28 | 동일 차트의 AuK-Flash: 3.87 |
이미지 분석


67
LIKES
179
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.