본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

microsoft/VibeVoice

Python0 / 0

VibeVoice는 초저주파 토크나이저와 확산 모델 기반의 LLM 아키텍처를 활용하여 장문 음성 인식(ASR) 및 실시간 음성 합성(TTS)을 수행하는 오픈소스 프레임워크이다.

핵심 포인트

  • 최대 60분의 장문 오디오를 단일 패스로 처리하여 화자 일관성 및 전체 문맥 유지
  • 화자 분리(Diarization)와 타임스탬프를 포함한 구조화된 전사 데이터 생성
  • 300ms 수준의 낮은 지연 시간을 보장하는 0.5B 규모의 실시간 스트리밍 TTS 제공
  • 사용자 정의 핫워드 기능을 통한 특정 도메인 용어 및 고유 명사 인식률 개선

48.2k

STARS

5.4k

FORKS

+276

TRENDING

0

조회수

watchers 48.2kopen issues 161MIT License

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.