4.62GB에서 1.58GB로 압축된 실시간 CPU용 다국어 ASR 모델
엣지 CPU에서 실시간으로 동작하도록 VAE 토크나이저는 INT8, LM 디코더는 I2_S+Q6_K로 이종 양자화한 다국어 음성인식 모델이다.
TL;DR
VibeVoice-ASR-BitNet은 microsoft/VibeVoice-ASR을 기반으로 컴포넌트별 이종 양자화를 적용하여 FP16 4.62 GB 모델을 1.58 GB로 압축하고 엣지 CPU에서 실시간 전사를 달성한 모델이다. VAE 토크나이저는 INT8(I8_S)로 임베딩을 생성하고 LM 디코더는 I2_S와 Q6_K를 결합해 가중치를 강하게 압축하며, ggml 내의 fused INT8 연산과 AVX2/NEON용 SIMD 커널이 CPU 추론 병목을 완화하여 3스레드에서 RTF 0.77을 기록했다. 다국어 벤치마크에서 일부 세트는 원본 대비 소폭 WER 저하가 관찰되었으나 전반적으로 엣지 배포와 실시간 성능을 얻는 트레이드오프가 합리적으로 관리되었다.
핵심 역량
- VibeVoice-ASR-BitNet은 엣지 x86 및 ARM CPU에서 3개 스레드로 RTF < 1의 실시간 추론을 달성하여 GPU 없이도 저지연 전사를 제공할 수 있다. 모델은 오디오를 ConvNeXt 기반 VAE 토크나이저로 압축한 뒤 INT8 임베딩을 생성하고, 이를 LM 디코더에 삽입하여 autoregressive 방식으로 문자를 생성한다. 양자화와 SIMD 최적화로 메모리 사용과 연산 대역폭을 줄여 모바일·임베디드 환경으로 배포가 가능하다.
- 모델은 영어, 중국어, 프랑스어, 이탈리아어, 한국어, 포르투갈어, 베트남어 등 다국어 전사를 지원하여 다양한 언어의 음성 데이터를 처리할 수 있다. VAE 토크나이저는 입력 오디오를 64~128차원의 압축 표현으로 변환하고 LM 디코더는 이 임베딩을 기반으로 문맥을 유지하며 텍스트를 생성한다. 양자화된 파라미터는 디코더의 메모리 발자국을 줄이면서 실시간 처리 성능을 유지하도록 설계되었다.
- 커스텀 SIMD 커널과 fused INT8 연산이 ggml 프레임워크 내에서 사용되어 AVX2 및 NEON 명령어로 행렬 연산을 병렬화한다. Conv 및 Depthwise Conv 연산은 배치와 채널 치환을 고려한 레이아웃으로 구현되어 캐시 친화성을 높였다. 덕분에 동일한 CPU 자원에서 FP16 대비 수배 빠른 처리량을 확보했다.
강점
- 전체 모델 용량을 4.62 GB에서 1.58 GB로 압축한 점이 실용적 이점으로 나타났으며 이는 엣지 장치의 메모리 제약을 직접 완화한다. 압축은 컴포넌트별로 적절한 비트폭을 할당하는 이종 양자화를 통해 달성되었다. 결과적으로 메모리 대역폭과 캐시 사용량이 줄어들어 CPU에서의 추론 속도 향상에 기여했다.
- 실험에서 3스레드 기준 RTF 0.77을 기록하여 Whisper.cpp 대비 약 1.86배 빠른 디코딩 속도를 보였고 이는 실시간 대화형 응용에서 지연을 낮추는 데 유리하다. 벤치마크는 AMD EPYC 환경에서 20초 오디오를 사용해 측정되었으며 RTF 값은 스레드 수에 따라 선형적이지 않으나 다중 스레드에서 유의미한 가속이 관찰되었다. CPU 전용 최적화와 SIMD 커널 도입이 성능 우위의 핵심 요인이다.
- 다국어 데이터셋에서 주요 언어에 대해 경쟁력 있는 WER 수치를 유지하여 압축에 따른 정확도 손실이 일정 수준으로 관리되었음이 확인되었다. 일부 벤치마크(예: MLC-EN, VoxPopuli)에서는 원본 대비 근접한 성능을 보였고 특정 세트에서는 소폭의 성능 저하가 관찰되었다. 따라서 대형 서버 환경 대비 미세한 정확도 손실을 감수하는 대신 엣지 배포와 저지연을 얻을 수 있다.
훈련 방식
VibeVoice-ASR-BitNet은 microsoft/VibeVoice-ASR을 기반으로 출발하여 구성 요소별로 서로 다른 양자화 기법을 적용하는 이종 양자화 전략을 사용했다. VAE 토크나이저는 INT8(I8_S)로 변환되어 임베딩 생성 파이프라인을 경량화했고 LM 디코더는 I2_S와 Q6_K 조합으로 가중치 압축을 극대화했다. 이러한 접근은 원본 FP16 모델을 유지하면서도 엣지 CPU에서 실시간 추론을 가능하게 하기 위해 선택되었다.
알아두면 좋은 것
- 모델 전체 용량을 FP16 4.62 GB에서 이종 양자화로 1.58 GB로 압축하여 저장 공간과 메모리 대역폭을 2.9배 절감했다.
- 실험 결과 AMD EPYC 환경에서 스레드 수에 따라 1.98에서 0.42까지 RTF를 기록했으며 3스레드에서 RTF 0.77로 Whisper.cpp보다 약 1.86배 빠른 성능을 보였다.
- 구성 요소별로 VAE 토크나이저는 I8_S, LM 디코더는 I2_S와 Q6_K를 사용하여 서로 다른 양자화 스킴을 적용함으로써 정확도 손실을 최소화하면서 압축을 극대화했다.
- ggml 기반의 커스텀 SIMD 커널(AVX2/NEON)과 fused INT8 연산이 도입되어 CPU 전용 환경에서 실시간 처리 성능을 달성했다.
기술적 특징
- 이종 양자화 전략은 모델의 서로 다른 컴포넌트에 맞춘 비트폭을 적용하여 정확도와 압축률을 균형 있게 유지한다. VAE 토크나이저는 I8_S로 양자화되어 임베딩 파이프라인의 메모리와 연산을 축소했고 LM 디코더는 I2_S와 Q6_K를 결합해 디코더 파라미터를 강하게 압축했다. 이러한 구성은 전체 모델 크기를 4.62 GB에서 1.58 GB로 줄이는 근거가 되었다.
- BitNet 계열의 I2_S 구현은 가중치를 ternary 수준으로 표현하고 덧셈/뺄셈 중심의 근사 점곱으로 연산을 전환하여 MAC 병목을 완화한다. 이 접근은 CPU에서 곱셈보다 데이터 이동과 단순 정수 연산이 상대적으로 저비용인 특성을 활용한 것이다. 결과적으로 AVX2 및 NEON 명령 집합에서 효율적인 매핑이 가능해져 실시간 처리 성능이 향상되었다.
- VAE 토크나이저는 ConvNeXt 계열의 x7 스테이지로 오디오를 처리하여 64~128차원 압축 표현을 생성하고 이 표현을 LM에 주입하는 구조를 사용한다. 토크나이저 자체를 INT8로 유지하면 임베딩 생성 단계에서 FP16↔INT8 변환 오버헤드를 최소화할 수 있다. 이 설계는 임베딩 전달 대역폭을 줄여 전체 파이프라인의 병목을 완화했다.
- ggml 프레임워크 내에서 fused INT8 연산과 커스텀 SIMD 커널을 구현하여 conv, depthwise conv, 행렬곱+bias+ReLU 등의 연산을 하나의 루틴으로 결합했다. 이 결합은 메모리 접근 횟수를 줄이고 레지스터-캐시 친화적 데이터 레이아웃을 유지하여 처리량을 높였다. AVX2 및 NEON에 특화된 코드 경로로 x86과 ARM 환경 모두에서 성능을 확보했다.
차별점
- 컴포넌트별 이종 양자화를 통해 VAE 토크나이저와 LM 디코더에 서로 다른 비트폭을 적용하여 압축률과 정확도 간의 균형을 세밀하게 조정한 점이 차별점이다. 이 접근은 전체 모델을 일괄적으로 양자화하는 방식보다 특정 블록의 정밀도를 보존하면서도 전반적인 용량을 더 크게 줄였다. 결과적으로 엣지 메모리 제약을 만족하면서 실시간 성능을 유지할 수 있었다.
- I2_S 기반의 ternary 가중치와 덧셈/뺄셈 중심의 근사 점곱 구현은 CPU 상에서 곱셈 비용을 줄여 SIMD 명령으로 효율적으로 매핑되는 연산으로 대체한 점이 독특하다. 이 기법은 특히 x86 AVX2와 ARM NEON 환경에서 메모리 대역폭 대비 연산 효율을 높였다. 따라서 동일 자원에서 FP16 구현보다 높은 처리량을 달성했다.
- ggml 프레임워크에 맞춘 fused INT8 연산 및 커스텀 SIMD 커널은 컨볼루션과 행렬 연산을 연속적으로 결합하여 메모리 접근을 최소화했고 이는 실시간 RTF 개선으로 연결되었다. 커널 수준에서의 최적화는 라이브러리 의존성 없이 CPU 기반 배포에 직접적인 이점을 제공한다. 이러한 낮은 수준 최적화는 엣지 배포 시 전체 시스템 지연을 줄이는 데 기여했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| RTF @3 threads | RTF | 0.77 | vs Whisper.cpp: 1.86× |
| Model size compression | Size (GB) | FP16 4.62 → Quantized 1.58 (2.9×) | — |
| MLC-EN WER | WER% | 8.25 | VibeVoice-ASR-7B: 7.82 |
| VoxPopuli WER | WER% | 5.18 | VibeVoice-ASR-7B: 4.92 |
이미지 분석

120
Likes
3.9k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.