OpenMOSS-Team/MOSS-Transcribe-Diarize
장문 다중화자 음성 전사 및 화자 분리(diarization) — 타임스탬프·핫워드·음향 이벤트 포함0.9Bapache-2.0
OpenMOSS의 0.9B 종단형 오디오 이해 모델로 최대 90분 길이의 다중화자 오디오를 한 번의 추론으로 화자 분리·타임스탬프까지 포함해 전사한다.
TL;DR
MOSS-Transcribe-Diarize 0.9B는 별도의 ASR·화자분리 파이프라인을 잇는 대신 두 작업을 하나의 모델로 동시에 수행해, 최대 90분 길이의 회의·통화·팟캐스트 녹음을 [S01], [S02] 같은 익명 화자 라벨과 시작·종료 타임스탬프가 붙은 텍스트로 한 번에 변환한다. AISHELL-4·Alimeeting·Podcast·Movies 네 벤치마크의 cpCER에서 각각 15.83·22.17·7.37·12.76을 기록해 Doubao·ElevenLabs·Gemini 3 Pro 등과 비교해 대부분 항목에서 앞섰고, 2026년 INTERSPEECH 2nd MLC-SLM Challenge(14개 언어)에서 1위를 차지했다. 커스텀 핫워드 프롬프트로 도메인 특화 용어 인식을 보정할 수 있고 음향 이벤트 주석까지 함께 낼 수 있어 다운스트림 시스템에 더 풍부한 맥락을 제공한다. SGLang Omni나 vLLM을 통해 OpenAI 호환 /v1/audio/transcriptions 엔드포인트로 서빙할 수 있어 기존 Whisper API 클라이언트를 그대로 붙일 수 있다.
핵심 포인트
- ASR과 화자분리를 별도 파이프라인이 아닌 하나의 모델로 동시에 처리해 최대 90분 오디오를 한 번에 전사한다.
- 네 벤치마크 cpCER에서 Doubao·ElevenLabs·Gemini 3 Pro를 앞서고 INTERSPEECH 2026 MLC-SLM 1위를 했다.
- 커스텀 핫워드 프롬프트로 도메인 용어 인식을 보정할 수 있고 음향 이벤트 주석까지 함께 생성한다.
- SGLang Omni·vLLM으로 OpenAI 호환 /v1/audio/transcriptions 엔드포인트를 그대로 제공해 기존 클라이언트를 재사용할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Podcast cpCER | cpCER | 7.37 | Doubao 10.54, ElevenLabs 11.34 |
| AISHELL-4 cpCER | cpCER | 15.83 | Doubao 27.86 |
| Movies cpCER | cpCER | 12.76 | Doubao 30.88 |
329
LIKES
123.5k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.