본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

microsoft/VibeVoice-ASR-BitNet

자동 음성 인식(ASR) — 엣지 CPU 실시간 추론용 경량화 모델mit

VibeVoice-ASR을 4.62GB에서 1.58GB로 압축한 BitNet 경량화판으로 GPU 없이 CPU 3스레드에서 실시간(RTF<1) 다국어 음성인식을 수행한다.

학습 방식 · microsoft/VibeVoice-ASR(7B)를 기반으로 VAE 토크나이저와 LM 디코더를 각각 다른 비트폭으로 사후 양자화(heterogeneous quantization)해 압축했다.

TL;DR

VibeVoice-ASR-BitNet은 microsoft/VibeVoice-ASR을 이질적 양자화로 4.62GB에서 1.58GB(2.9배 압축)로 줄인 GGUF 모델로, VAE 토크나이저는 I8_S, LM 디코더는 I2_S+Q6_K로 각각 압축했다. ggml 프레임워크의 커스텀 SIMD 커널로 x86(AVX2)·ARM(NEON) CPU에서 3스레드만으로도 RTF 0.77의 실시간 추론을 내며 Whisper.cpp보다 1.6~2.3배 빠르다. 영어 등 다국어 WER은 원본 7B 모델과 큰 차이 없이 유지되지만(MLC-EN 8.25 vs 7.82) AISHELL4·AliMeeting 같은 다인 화자 회의 녹음에서는 정확도가 눈에 띄게 낮아진다. GPU 없이 엣지 디바이스에서 실시간 자막·회의록을 뽑아야 하는 상황에 적합하다.

핵심 포인트

  • VAE 토크나이저 I8_S, LM 디코더 I2_S+Q6_K로 이질적 양자화해 4.62GB를 1.58GB로 2.9배 압축했다.
  • x86 AVX2·ARM NEON용 커스텀 SIMD 커널로 CPU 3스레드만으로 RTF<1(실시간) 추론을 낸다.
  • MLC-EN WER 8.25로 원본 7B 모델(7.82)과 큰 격차 없이 유지하면서 Whisper.cpp보다 1.6~2.3배 빠르다.

제한사항

  • AISHELL4·AliMeeting 같은 원거리·다인 화자 회의 조건에서는 WER이 원본 7B 모델보다 눈에 띄게 높아진다(예: AISHELL4 27.45 vs 19.83).
  • 영어 외 언어(프랑스어·이탈리아어·한국어·포르투갈어·베트남어)에서도 원본 대비 WER이 소폭 상승한다.

벤치마크

벤치마크지표비교
MLC-EN WERWER%8.25VibeVoice-ASR-7B 7.82
RTF (3 threads)real-time factor0.77Whisper.cpp 대비 1.86배 빠름

163

LIKES

10.1k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.