본문으로 건너뛰기
Simon Willison조회 5

Microsoft VibeVoice: 화자 분리 기능이 내장된 오픈 소스 음성 인식 모델

Microsoft가 출시한 VibeVoice는 화자 분리 기능이 내장된 MIT 라이선스 음성 인식 모델로, MLX를 통해 Mac 환경에서 고속 추론이 가능하다.

섹션별 상세

VibeVoice는 모델 아키텍처 내부에 화자 분리 기능이 통합되어 있어 추가적인 파이프라인 없이도 대화 참여자를 구분한다. 기존 음성 인식 시스템들이 텍스트 추출 후 별도의 모델로 화자를 식별하던 번거로움을 해결했다. 실제 팟캐스트 데이터 테스트에서 진행자와 게스트는 물론, 광고를 읽는 목소리까지 별도의 화자 ID로 정확히 분류했다.
MLX 프레임워크와 uv 패키지 매니저를 활용하여 Mac 환경에서 매우 간편하고 빠르게 실행할 수 있다. mlx-audio 라이브러리를 사용하면 단 한 줄의 명령어로 4비트 양자화된 모델을 다운로드하고 추론을 시작할 수 있다. 17.3GB의 원본 모델 대신 5.71GB로 경량화된 모델을 사용하여 메모리 효율성을 극대화했다.
근거
  • 4비트 양자화된 VibeVoice 모델의 크기는 5.71GB이다. mlx-community/VibeVoice-ASR-4bit 모델 설명 부분 출처
추론 성능 측정 결과 1시간 분량의 오디오 처리에 약 524.79초가 소요되었으며 피크 메모리는 약 30.44GB를 기록했다. 프롬프트 처리 속도는 초당 50.718 토큰, 생성 속도는 초당 38.585 토큰으로 나타났다. 다만 프리필 단계에서 일시적으로 61.5GB까지 메모리 점유율이 상승하므로 고사양 통합 메모리 환경이 권장된다.
macOS 터미널에서 mlx-audio를 사용하여 VibeVoice 모델을 실행하는 과정과 결과 통계 화면
ScreenshotVibeVoice 모델의 실제 실행 명령어와 추론 성능 수치를 보여준다. 처리 시간(524.79초), 토큰 생성 속도(38.585 t/s), 피크 메모리 사용량(30.44 GB) 등 구체적인 벤치마크 데이터를 확인할 수 있다.
근거
  • VibeVoice는 1시간 분량의 오디오를 약 8분 45초 만에 처리했다. Processing time: 524.79 seconds 수치 언급
현재 모델은 단일 실행 시 최대 1시간 분량의 오디오까지만 처리할 수 있는 기술적 제약이 존재한다. 1시간 이상의 긴 오디오를 처리하려면 파일을 분할해야 하며, 이때 단어 잘림을 방지하기 위해 약 1분 정도의 중첩 구간을 두는 것이 좋다. 분할된 결과물들을 합칠 때는 각 세그먼트 간의 화자 ID를 일관성 있게 정렬하는 추가 작업이 필요하다.

기술

  • VibeVoice
  • mlx-audio
  • uv
  • Python
  • MLX

활용 사례

  • 팟캐스트 스크립트 자동 생성
  • 회의록 화자별 자동 분류
  • 로컬 음성 데이터 전사 서비스
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 28.수집 2026. 04. 28.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.