400M 파라미터로 구현한 실시간 대화형 TTS, RTX 5080에서 RTF 0.2 달성
텍스트 음성 변환 (Text-to-Speech) 및 음성 복제 (Voice Cloning)400Mlfm1.0
LLM과 FSQ 코덱을 결합하여 실시간 대화와 음성 복제에 최적화된 400M 규모의 영어 TTS 모델입니다.
핵심 역량
- 400M 파라미터의 경량화된 모델 구조
- RTX 5080 기준 RTF 0.2의 매우 빠른 추론 속도
- Speaker Embedding을 활용한 제로샷 음성 복제(Voice Cloning)
- 22kHz 샘플 레이트의 고품질 오디오 출력
- 3GB VRAM 미만의 낮은 메모리 점유로 로컬 실행 가능
알아두면 좋은 것
- RTX 5080에서 RTF 0.2 및 3GB VRAM 사용으로 로컬 환경 최적화 확인
- 입력 텍스트 길이가 약 40초를 초과할 경우 음질 및 성능 저하 발생 가능
- 현재 영어(en)에 최적화되어 있으며 한국어 등 타 언어는 추가 학습 권장
- laion/Emolia 데이터셋과 약 1만 시간의 오디오 데이터를 활용한 사전 학습
170
Likes
3.4k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.