60분 장문 음성도 한 번에 처리하는 Microsoft의 차세대 오픈소스 Voice AI
AI Tool·Python23 / 0
VibeVoice는 초저주파 토크나이저와 확산 모델 기반의 LLM 아키텍처를 활용하여 장문 음성 인식(ASR) 및 실시간 음성 합성(TTS)을 수행하는 오픈소스 프레임워크이다.
주요 기능
- 최대 60분의 장문 오디오를 단일 패스로 처리하여 화자 일관성 및 전체 문맥 유지
- 화자 분리(Diarization)와 타임스탬프를 포함한 구조화된 전사 데이터 생성
- 300ms 수준의 낮은 지연 시간을 보장하는 0.5B 규모의 실시간 스트리밍 TTS 제공
- 사용자 정의 핫워드 기능을 통한 특정 도메인 용어 및 고유 명사 인식률 개선
- 50개 이상의 다국어 지원 및 vLLM을 활용한 고속 추론 환경 구축 가능
어떻게 동작하는가
7.5 Hz 초저주파 연속 음성 토크나이저로 오디오를 압축하고, Qwen2.5 기반 LLM이 텍스트 문맥을 분석하며 Diffusion 헤드가 고정밀 음향 세부 사항을 복원하는 Next-token Diffusion 구조를 취한다.
48.2k
Stars
5.4k
Forks
+276
Trending
23
조회수
48.2k watchers161 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.