fishaudio/s2-pro
텍스트를 음성으로 합성하는 다국어 음성 합성 (인라인 태그로 운율·감정 국소 제어)4B (Slow AR) + 400M (Fast AR)fish-audio-research-license (비상업적 무료, 상업적 이용은 별도 라이선스 필요)
문장 안에 자유 형식 태그를 넣어 억양·감정을 세밀하게 지시할 수 있는 80개 이상 언어 지원 TTS.
학습 방식 · 디코더 전용 트랜스포머와 RVQ 오디오 코덱을 결합한 Dual-AR 구조를 강화학습 정렬과 함께 1000만 시간 이상의 80개 이상 언어 오디오 데이터로 학습했다.
TL;DR
Fish Audio S2 Pro는 1000만 시간 이상의 오디오 데이터를 80개 이상 언어로 학습한 TTS 모델로, RVQ 기반 오디오 코덱(10개 코드북, 약 21Hz 프레임)과 Dual-AR 구조를 결합했다. 느린 AR(4B)이 시간축을 따라 주요 의미 코드북을 예측하고 빠른 AR(400M)이 각 스텝에서 나머지 9개 잔차 코드북을 채워 세밀한 음향 디테일을 복원하는 비대칭 설계다. 문장 중간에 [whisper in small voice]처럼 자유 형식 텍스트 태그를 넣어 특정 단어의 톤·감정·속도를 국소적으로 제어할 수 있고, 15,000개 이상의 태그가 이미 검증됐다. 표준 LLM과 구조적으로 동일한 Dual-AR 덕분에 SGLang의 연속 배치·페이지드 KV 캐시·RadixAttention 등 서빙 최적화를 그대로 물려받아, H200 한 장에서 RTF 0.195, 초당 3,000+ 음향 토큰 처리량과 약 100ms의 첫 음성 지연을 낸다.
핵심 포인트
- 느린 AR(4B)이 의미 코드북을, 빠른 AR(400M)이 9개 잔차 코드북을 채우는 Dual-AR 구조다.
- 문장 안에 자유 형식 태그를 넣어 단어 단위로 톤·감정·속도를 제어하고 15,000개 이상이 검증됐다.
- 구조가 표준 LLM과 같아 SGLang의 연속 배치·페이지드 KV 캐시·RadixAttention을 물려받는다.
- 일본어·영어·중국어를 Tier 1, 한국어·스페인어 등을 Tier 2로 나눠 80개 이상 언어를 지원한다.
제한사항
- Fish Audio Research License로 배포돼 연구·비상업적 이용만 무료이며, 상업적 이용은 별도 라이선스 계약이 필요하다.
- 접근 신청 시 비상업적 이용 동의와 국가·날짜 정보를 제출해야 하며, DMCA·현지법 위반 콘텐츠 생성이 명시적으로 금지된다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Fish Audio S2 Pro (H200) | Real-Time Factor (RTF) | 0.195 | — |
| Fish Audio S2 Pro (H200) | Time-to-first-audio | ~100ms | — |
| Fish Audio S2 Pro (H200) | Throughput (RTF<0.5 유지) | 3,000+ tokens/s | — |
1.2k
LIKES
367.7k
DOWNLOADS
3 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.