본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nineninesix/kani-tts-2-en

텍스트 음성 변환 (Text-to-Speech) 및 음성 복제 (Voice Cloning)400Mlfm1.0

LLM과 FSQ 코덱을 결합하여 실시간 대화와 음성 복제에 최적화된 400M 규모의 영어 TTS 모델입니다.

핵심 포인트

  • 400M 파라미터의 경량화된 모델 구조
  • RTX 5080 기준 RTF 0.2의 매우 빠른 추론 속도
  • Speaker Embedding을 활용한 제로샷 음성 복제(Voice Cloning)
  • 22kHz 샘플 레이트의 고품질 오디오 출력

170

LIKES

3.4k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.