본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

microsoft/VibeVoice-ASR

자동 음성 인식 및 화자 분리mit

시각적 보조 정보를 활용하여 노이즈 환경에서도 정확한 음성 인식과 화자 분리를 수행하는 Microsoft의 다국어 ASR 모델이다.

학습 방식 · VibeVoice 아키텍처 기반의 시각-음성 멀티모달 학습 및 대규모 다국어 음성 데이터셋 활용

핵심 포인트

  • MIT 라이선스로 상업적 활용에 제약이 없음
  • 화자 분리 기능을 통합하여 추가 모델 없이 대화 분석 가능
  • 노이즈가 많은 실제 환경에서 높은 인식 정확도 유지
  • 다국어 음성 인식 (50개 이상의 언어)

1.1k

LIKES

644.3k

DOWNLOADS

2 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.