본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

microsoft/VibeVoice-ASR-Streaming-7B

화자 구분 음성 인식 및 실시간 음성 전사7BMIT

화자 정보와 음성 내용을 함께 처리하는 10개 언어 지원 streaming ASR 모델

TL;DR

VibeVoice-ASR-Streaming-7B는 7B 규모의 unified streaming ASR 모델로, 음성이 들어오는 동안 발화 내용과 화자 정보를 함께 전사합니다. Acoustic Tokenizer Encoder와 Semantic Tokenizer Encoder가 음성을 연속 latent와 discrete text token으로 변환하고, chunk 단위 처리와 lookahead latent를 활용해 스트리밍 출력을 이어갑니다. 사용자가 이름이나 기술 용어를 hotword로 지정할 수 있으며, 영어·중국어·프랑스어·독일어·이탈리아어·일본어·한국어·포르투갈어·러시아어·스페인어를 지원합니다. 공개 평가 차트에서는 MLC-Challenge에서 WER/CER 17.1%를 기록해 비교 대상 중 가장 낮은 수치를 보입니다.

핵심 포인트

  • 음성이 도착하는 순서에 맞춰 화자별 발화 내용을 연속적으로 전사합니다.
  • Acoustic·Semantic Tokenizer와 transcription·lookahead latent를 결합해 chunk 단위로 처리합니다.
  • 사용자 지정 hotword를 입력해 이름과 기술 용어가 포함된 도메인 음성 인식을 보강합니다.
  • 10개 언어를 지원하며 MLC-Challenge 차트에서 WER/CER 17.1%를 기록했습니다.

벤치마크

벤치마크지표비교
AliMeetingWER/CER (%)33.8차트 기준 Gemini 3.5 Transcribe Live 35.3, GPT Realtime Whisper 49.8, GPT Live Transcribe 49.6, ElevenLabs Scribe v2 Realtime 54.4
AISHELL-4WER/CER (%)22.8차트 기준 Gemini 3.5 Transcribe Live 30.1, GPT Realtime Whisper 45.9, GPT Live Transcribe 45.2, ElevenLabs Scribe v2 Realtime 43.7
AMI-SDMWER/CER (%)29.8차트 기준 Gemini 3.5 Transcribe Live 27.2, GPT Realtime Whisper 43.9, GPT Live Transcribe 43.4, ElevenLabs Scribe v2 Realtime 39.8
AMI-IHMWER/CER (%)19.8차트 기준 Gemini 3.5 Transcribe Live 19.9, GPT Realtime Whisper 29.6, GPT Live Transcribe 30.8, ElevenLabs Scribe v2 Realtime 31.9
MLC-ChallengeWER/CER (%)17.1차트 기준 Gemini 3.5 Transcribe Live 13.7, GPT Realtime Whisper 27.3, GPT Live Transcribe 33.8, ElevenLabs Scribe v2 Realtime 37.2

이미지 분석

VibeVoice-ASR-Streaming이 음성 구간을 Acoustic·Semantic Tokenizer Encoder로 변환한 뒤 latent와 text token을 스트리밍 순서로 결합하는 구조도입니다.
구조도는 화자별 음성 구간에서 Acoustic Tokenizer와 Semantic Tokenizer가 각각 표현을 추출하고, 두 표현을 결합해 Continuous Transcription Latent와 Continuous Lookahead Latent를 생성하는 흐름을 담고 있습니다. VibeVoice-ASR-Streaming은 이 latent와 BOS·EOC·discrete text token을 chunk 단위로 주고받아 음성이 이어지는 동안 화자 발화와 전사 결과를 함께 출력합니다.
AliMeeting, AISHELL-4, AMI-SDM, AMI-IHM, MLC-Challenge에서 VibeVoice-ASR-Streaming-7B와 네 가지 비교 시스템의 WER/CER 수치를 비교한 막대그래프입니다.
그래프의 가로축은 낮을수록 좋은 WER/CER(%)이며, VibeVoice-ASR-Streaming-7B는 AliMeeting 33.8, AISHELL-4 22.8, AMI-SDM 29.8, AMI-IHM 19.8, MLC-Challenge 17.1을 기록합니다. 비교 대상 중 VibeVoice의 수치가 AMI-IHM에서는 Gemini 3.5 Transcribe Live의 19.9와 비슷하고, MLC-Challenge에서는 17.1로 가장 낮지는 않지만 다른 세 시스템보다 낮게 나타납니다.

110

LIKES

889

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.