microsoft/VibeVoice-ASR-BitNet
자동 음성 인식(ASR) — 엣지 CPU 실시간 추론용 경량화 모델mit
VibeVoice-ASR을 4.62GB에서 1.58GB로 압축한 BitNet 경량화판으로 GPU 없이 CPU 3스레드에서 실시간(RTF<1) 다국어 음성인식을 수행한다.
학습 방식 · microsoft/VibeVoice-ASR(7B)를 기반으로 VAE 토크나이저와 LM 디코더를 각각 다른 비트폭으로 사후 양자화(heterogeneous quantization)해 압축했다.
TL;DR
VibeVoice-ASR-BitNet은 microsoft/VibeVoice-ASR을 이질적 양자화로 4.62GB에서 1.58GB(2.9배 압축)로 줄인 GGUF 모델로, VAE 토크나이저는 I8_S, LM 디코더는 I2_S+Q6_K로 각각 압축했다. ggml 프레임워크의 커스텀 SIMD 커널로 x86(AVX2)·ARM(NEON) CPU에서 3스레드만으로도 RTF 0.77의 실시간 추론을 내며 Whisper.cpp보다 1.6~2.3배 빠르다. 영어 등 다국어 WER은 원본 7B 모델과 큰 차이 없이 유지되지만(MLC-EN 8.25 vs 7.82) AISHELL4·AliMeeting 같은 다인 화자 회의 녹음에서는 정확도가 눈에 띄게 낮아진다. GPU 없이 엣지 디바이스에서 실시간 자막·회의록을 뽑아야 하는 상황에 적합하다.
핵심 포인트
- VAE 토크나이저 I8_S, LM 디코더 I2_S+Q6_K로 이질적 양자화해 4.62GB를 1.58GB로 2.9배 압축했다.
- x86 AVX2·ARM NEON용 커스텀 SIMD 커널로 CPU 3스레드만으로 RTF<1(실시간) 추론을 낸다.
- MLC-EN WER 8.25로 원본 7B 모델(7.82)과 큰 격차 없이 유지하면서 Whisper.cpp보다 1.6~2.3배 빠르다.
제한사항
- AISHELL4·AliMeeting 같은 원거리·다인 화자 회의 조건에서는 WER이 원본 7B 모델보다 눈에 띄게 높아진다(예: AISHELL4 27.45 vs 19.83).
- 영어 외 언어(프랑스어·이탈리아어·한국어·포르투갈어·베트남어)에서도 원본 대비 WER이 소폭 상승한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| MLC-EN WER | WER% | 8.25 | VibeVoice-ASR-7B 7.82 |
| RTF (3 threads) | real-time factor | 0.77 | Whisper.cpp 대비 1.86배 빠름 |
163
LIKES
10.1k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.