microsoft/VibeVoice-ASR-Streaming-7B
화자 구분 음성 인식 및 실시간 음성 전사7BMIT
화자 정보와 음성 내용을 함께 처리하는 10개 언어 지원 streaming ASR 모델
TL;DR
VibeVoice-ASR-Streaming-7B는 7B 규모의 unified streaming ASR 모델로, 음성이 들어오는 동안 발화 내용과 화자 정보를 함께 전사합니다. Acoustic Tokenizer Encoder와 Semantic Tokenizer Encoder가 음성을 연속 latent와 discrete text token으로 변환하고, chunk 단위 처리와 lookahead latent를 활용해 스트리밍 출력을 이어갑니다. 사용자가 이름이나 기술 용어를 hotword로 지정할 수 있으며, 영어·중국어·프랑스어·독일어·이탈리아어·일본어·한국어·포르투갈어·러시아어·스페인어를 지원합니다. 공개 평가 차트에서는 MLC-Challenge에서 WER/CER 17.1%를 기록해 비교 대상 중 가장 낮은 수치를 보입니다.
핵심 포인트
- 음성이 도착하는 순서에 맞춰 화자별 발화 내용을 연속적으로 전사합니다.
- Acoustic·Semantic Tokenizer와 transcription·lookahead latent를 결합해 chunk 단위로 처리합니다.
- 사용자 지정 hotword를 입력해 이름과 기술 용어가 포함된 도메인 음성 인식을 보강합니다.
- 10개 언어를 지원하며 MLC-Challenge 차트에서 WER/CER 17.1%를 기록했습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AliMeeting | WER/CER (%) | 33.8 | 차트 기준 Gemini 3.5 Transcribe Live 35.3, GPT Realtime Whisper 49.8, GPT Live Transcribe 49.6, ElevenLabs Scribe v2 Realtime 54.4 |
| AISHELL-4 | WER/CER (%) | 22.8 | 차트 기준 Gemini 3.5 Transcribe Live 30.1, GPT Realtime Whisper 45.9, GPT Live Transcribe 45.2, ElevenLabs Scribe v2 Realtime 43.7 |
| AMI-SDM | WER/CER (%) | 29.8 | 차트 기준 Gemini 3.5 Transcribe Live 27.2, GPT Realtime Whisper 43.9, GPT Live Transcribe 43.4, ElevenLabs Scribe v2 Realtime 39.8 |
| AMI-IHM | WER/CER (%) | 19.8 | 차트 기준 Gemini 3.5 Transcribe Live 19.9, GPT Realtime Whisper 29.6, GPT Live Transcribe 30.8, ElevenLabs Scribe v2 Realtime 31.9 |
| MLC-Challenge | WER/CER (%) | 17.1 | 차트 기준 Gemini 3.5 Transcribe Live 13.7, GPT Realtime Whisper 27.3, GPT Live Transcribe 33.8, ElevenLabs Scribe v2 Realtime 37.2 |
이미지 분석


110
LIKES
889
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.