microsoft/VibeVoice
Python0 / 0
VibeVoice는 초저주파 토크나이저와 확산 모델 기반의 LLM 아키텍처를 활용하여 장문 음성 인식(ASR) 및 실시간 음성 합성(TTS)을 수행하는 오픈소스 프레임워크이다.
핵심 포인트
- 최대 60분의 장문 오디오를 단일 패스로 처리하여 화자 일관성 및 전체 문맥 유지
- 화자 분리(Diarization)와 타임스탬프를 포함한 구조화된 전사 데이터 생성
- 300ms 수준의 낮은 지연 시간을 보장하는 0.5B 규모의 실시간 스트리밍 TTS 제공
- 사용자 정의 핫워드 기능을 통한 특정 도메인 용어 및 고유 명사 인식률 개선
48.2k
STARS
5.4k
FORKS
+276
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.