nineninesix/kani-tts-2-en
텍스트 음성 변환 (Text-to-Speech) 및 음성 복제 (Voice Cloning)400Mlfm1.0
LLM과 FSQ 코덱을 결합하여 실시간 대화와 음성 복제에 최적화된 400M 규모의 영어 TTS 모델입니다.
핵심 포인트
- 400M 파라미터의 경량화된 모델 구조
- RTX 5080 기준 RTF 0.2의 매우 빠른 추론 속도
- Speaker Embedding을 활용한 제로샷 음성 복제(Voice Cloning)
- 22kHz 샘플 레이트의 고품질 오디오 출력
170
LIKES
3.4k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.