microsoft/VibeVoice-ASR
자동 음성 인식 및 화자 분리mit
시각적 보조 정보를 활용하여 노이즈 환경에서도 정확한 음성 인식과 화자 분리를 수행하는 Microsoft의 다국어 ASR 모델이다.
학습 방식 · VibeVoice 아키텍처 기반의 시각-음성 멀티모달 학습 및 대규모 다국어 음성 데이터셋 활용
핵심 포인트
- MIT 라이선스로 상업적 활용에 제약이 없음
- 화자 분리 기능을 통합하여 추가 모델 없이 대화 분석 가능
- 노이즈가 많은 실제 환경에서 높은 인식 정확도 유지
- 다국어 음성 인식 (50개 이상의 언어)
1.1k
LIKES
644.3k
DOWNLOADS
2 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.