본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

fishaudio/s2-pro

텍스트를 음성으로 합성하는 다국어 음성 합성 (인라인 태그로 운율·감정 국소 제어)4B (Slow AR) + 400M (Fast AR)fish-audio-research-license (비상업적 무료, 상업적 이용은 별도 라이선스 필요)

문장 안에 자유 형식 태그를 넣어 억양·감정을 세밀하게 지시할 수 있는 80개 이상 언어 지원 TTS.

학습 방식 · 디코더 전용 트랜스포머와 RVQ 오디오 코덱을 결합한 Dual-AR 구조를 강화학습 정렬과 함께 1000만 시간 이상의 80개 이상 언어 오디오 데이터로 학습했다.

TL;DR

Fish Audio S2 Pro는 1000만 시간 이상의 오디오 데이터를 80개 이상 언어로 학습한 TTS 모델로, RVQ 기반 오디오 코덱(10개 코드북, 약 21Hz 프레임)과 Dual-AR 구조를 결합했다. 느린 AR(4B)이 시간축을 따라 주요 의미 코드북을 예측하고 빠른 AR(400M)이 각 스텝에서 나머지 9개 잔차 코드북을 채워 세밀한 음향 디테일을 복원하는 비대칭 설계다. 문장 중간에 [whisper in small voice]처럼 자유 형식 텍스트 태그를 넣어 특정 단어의 톤·감정·속도를 국소적으로 제어할 수 있고, 15,000개 이상의 태그가 이미 검증됐다. 표준 LLM과 구조적으로 동일한 Dual-AR 덕분에 SGLang의 연속 배치·페이지드 KV 캐시·RadixAttention 등 서빙 최적화를 그대로 물려받아, H200 한 장에서 RTF 0.195, 초당 3,000+ 음향 토큰 처리량과 약 100ms의 첫 음성 지연을 낸다.

핵심 포인트

  • 느린 AR(4B)이 의미 코드북을, 빠른 AR(400M)이 9개 잔차 코드북을 채우는 Dual-AR 구조다.
  • 문장 안에 자유 형식 태그를 넣어 단어 단위로 톤·감정·속도를 제어하고 15,000개 이상이 검증됐다.
  • 구조가 표준 LLM과 같아 SGLang의 연속 배치·페이지드 KV 캐시·RadixAttention을 물려받는다.
  • 일본어·영어·중국어를 Tier 1, 한국어·스페인어 등을 Tier 2로 나눠 80개 이상 언어를 지원한다.

제한사항

  • Fish Audio Research License로 배포돼 연구·비상업적 이용만 무료이며, 상업적 이용은 별도 라이선스 계약이 필요하다.
  • 접근 신청 시 비상업적 이용 동의와 국가·날짜 정보를 제출해야 하며, DMCA·현지법 위반 콘텐츠 생성이 명시적으로 금지된다.

벤치마크

벤치마크지표비교
Fish Audio S2 Pro (H200)Real-Time Factor (RTF)0.195
Fish Audio S2 Pro (H200)Time-to-first-audio~100ms
Fish Audio S2 Pro (H200)Throughput (RTF<0.5 유지)3,000+ tokens/s

1.2k

LIKES

367.7k

DOWNLOADS

3 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.