단일 패스 다중화자 전사와 타임스탬프 내장 0.9B 모델
이 모델은 긴 녹음의 장시간 전사와 익명 발화자 분리, 구간별 시작·종료 타임스탬프 생성을 통합된 출력으로 생성하는 audio-text-to-text 작업을 수행한다. 입력으로 오디오 또는 비디오 파일을 받아 WhisperFeatureExtractor로 특징을 계산하고 오디오-텍스트 브리지를 통해 시계열 특징을 텍스트 디코더의 토큰 임베딩 위치에 삽입하여 직접 생성이 이뤄진다. 또한 사용자 정의 프롬프트와 핫워드 힌트를 받아 특정 단어 우선 출력이나 음향 이벤트 주석을 포함하도록 출력 형식을 조정할 수 있다.0.9Bapache-2.0
MOSS-Transcribe-Diarize 0.9B는 Whisper 기반 오디오 인코더와 Qwen3 스타일 디코더를 결합해 단일 생성으로 전사·발화자 태그·타임스탬프를 동시에 출력하는 엔드투엔드 음성 이해 모델이다.
TL;DR
MOSS-Transcribe-Diarize 0.9B는 Whisper-Medium 스타일 오디오 인코더와 Qwen3-스타일 causal decoder를 결합하여 장시간 다중화자 녹음에서 전사, 익명 발화자 태그, 시작·종료 타임스탬프를 단일 생성 과정으로 출력하는 엔드투엔드 모델이다. 아키텍처는 30초 청크의 멜 스펙트로그램을 4배 temporal merge와 MLP 어댑터로 축약해 디코더에 삽입하고 masked_scatter 방식으로 오디오 특징을 토큰 임베딩 위치에 대체하여 발화자 일관성과 시간 정합성을 확보한다. 공개된 벤치마크에서 AISHELL-4 CER 14.84·cpCER 15.83 등 경쟁력 있는 오류율을 보였고 H100 단일 노드의 짧은 시퀀스와 긴 시퀀스 처리량·지연 표가 제공되어 실서비스 배포 성능을 검증할 수 있다.
핵심 역량
- 모델은 긴 다중화자 녹음에서 발화 구간마다 시작 및 종료 타임스탬프를 포함한 텍스트 전사를 생성하여 자막·검색·분석 파이프라인으로 곧바로 연결할 수 있다. 오디오 특징은 WhisperFeatureExtractor로 16 kHz·80 mel bins로 전처리되어 30초 청크 단위로 처리되고, 브리지 모듈은 이 시계열을 4배 병합한 뒤 MLP 어댑터로 디코더에 적절히 매핑하여 시간 해상도와 텍스트 정합성을 확보한다. 생성 결과는 익명 발화자 태그([S01], [S02] 등)를 포함하여 별도 diarization 파이프라인 없이 화자 일관성을 제공한다.
- 사용자는 기본 프롬프트를 통해 전사 형식과 핫워드를 지정할 수 있으며, 핫워드 힌트는 프롬프트에 덧붙여 특정 용어의 우선 생성을 유도한다. 프롬프트 템플릿은 processor.apply_chat_template 호출로 오디오 플레이스홀더를 포함한 메시지를 렌더링하고, processor(text=text, audio=audios) 단계에서 오디오 플레이스홀더가 실제 특징으로 확장된다. 이 흐름은 사용자 정의 지시문을 반영한 일관된 생성과 핫워드 강조를 가능하게 한다.
- 서빙 면에서는 vLLM과 SGLang Omni를 통해 OpenAI 호환 오디오 전사 엔드포인트로 배포할 수 있고, response_format=verbose_json로 파싱된 세그먼트 정보를 바로 얻을 수 있다. H100 기준 벤치마크가 README에 제공되어 짧은 시퀀스와 긴 시퀀스에서의 처리량과 지연 특성을 확인할 수 있다. max_new_tokens 파라미터를 증가시켜 긴 multi-speaker 오디오의 전체 디아리제이션 출력을 완성할 수 있도록 설계되었다.
강점
- 공개된 비교 표에 따르면 MOSS Transcribe Diarize 0.9B는 AISHELL-4 데이터셋에서 CER 14.84, cpCER 15.83, Δcp 0.99로 보고되어 장시간 다중화자 환경에서 경쟁력 있는 문자 단위 오류율을 보였다. 같은 표에서 Podcast와 Movies 데이터셋에서도 낮은 CER/ cpCER 값을 기록하여 다양한 도메인에서 성능을 확보했음을 나타낸다. 이러한 수치는 통합된 단일 생성 흐름이 전통적 분리 파이프라인 대비 발화자 일관성과 타임스탬프 정합성 측면에서 우위를 제공했음을 시사한다.
알아두면 좋은 것
- 모델은 Whisper-Medium 스타일 오디오 인코더와 Qwen3-0.6B 스타일 causal decoder를 결합해 단일 패스에서 전사와 디아리제이션을 동시에 생성한다.
- 출력 포맷은 [start][Sxx]transcribed speech[end] 형태로 통일되어 타임스탬프와 익명 발화자 태그를 포함한 컴팩트한 결과를 제공한다.
- 원격 Transformers 커스텀 코드가 포함되어 있어 모델 로드 시 trust_remote_code=True를 지정해야 하고, GitHub 패키지는 오디오 로딩·파싱·웹 앱 유틸리티를 제공한다.
- Apache-2.0 라이선스 하에 배포되며 vLLM·SGLang 서빙 예제와 H100 단일 노드 벤치마크 수치가 README에 포함되어 있다.
기술적 특징
- 오디오-텍스트 브리지는 4배 temporal merge와 MLP 어댑터를 통해 오디오 시계열을 디코더 입력에 맞추어 축약하고 매핑하여 시간 해상도와 토큰 정합성 간의 균형을 달성한다. 이 방식은 30초 청크로 나뉜 멜 스펙트로그램에서 시간 정보를 보존하면서 디코더의 causal 토크나이저 제약에 맞춰 입력 길이를 줄이는 역할을 한다. 결과적으로 긴 오디오를 처리할 때 디코더의 토큰 길이 한계를 완화하면서 타임스탬프 정밀도를 유지한다.
- 퓨전 레이어는 오디오 특징이 <|audio_pad|> 토큰 임베딩을 대체하도록 masked_scatter 방식으로 삽입되어 디코더가 오디오-조건부 생성으로 전사와 디아리제이션을 동시에 수행하게 한다. 이 방법은 별도 모듈 간의 I/O 전송을 줄이고 하나의 생성 메커니즘에서 발화자 태그와 텍스트를 일관되게 출력하도록 유도한다. 대체 삽입 방식은 멀티모달 입력을 디코더가 자연스럽게 소비하도록 만들어 생성 품질과 발화자 일관성에 기여한다.
- 오디오 프런트엔드는 WhisperFeatureExtractor를 사용해 16 kHz 샘플링과 80 mel bins로 특징을 계산하고 30초 단위 청크를 기본 처리 단위로 삼아 긴 입력을 분할 처리한다. 이러한 청크 기반 전처리는 연속된 긴 오디오에서 메모리 사용을 제어하고 브리지에서 병합할 때 시간 축 정보를 계층적으로 보존하는 설계를 가능하게 한다. 프런트엔드와 병합 어댑터의 조합은 긴 시퀀스에서 타임스탬프와 구간 경계를 보다 정확히 복원하는 데 기여한다.
- 모델 로딩과 실행에는 Remote Transformers 코드 로딩(trust_remote_code=True)이 요구되어 커스텀 토크나이저 및 processor 로직을 포함한 확장 기능을 지원한다. 이 구조는 processor.apply_chat_template 및 processor(text=text, audio=audios) 같은 유틸리티로 오디오 플레이스홀더를 관리하고 모델 생성 흐름에서 오디오를 자동으로 확장하여 일관된 입력 파이프라인을 유지한다. 원격 코드 의존성은 편의성과 확장성을 제공하지만 신뢰 설정과 배포 시 보안·호환성 점검이 필요하다.
차별점
- 단일 생성 단계에서 전사, 발화자 태깅, 타임스탬프를 동시에 출력하도록 설계되어 별도의 ASR·diarization 파이프라인 결합을 불필요하게 한다.
- Whisper-Medium 스타일 오디오 인코더와 Qwen3-스타일 causal decoder 조합으로 멀티모달 시계열을 디코더에 직접 삽입하는 masked_scatter 기반 퓨전 방식을 채택했다.
- 사용자 프롬프트로 핫워드와 전사 포맷을 직접 제어할 수 있어 특정 용어 우선처리나 출력 형식을 실시간으로 조정할 수 있다.
- vLLM 및 SGLang Omni와의 통합 서빙 예제와 H100 단일 노드 벤치마크 수치를 README에 제공하여 배포·성능 검증을 위한 실무 가이드를 포함하고 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AISHELL-4 CER | CER | 14.84 | — |
| AISHELL-4 cpCER | cpCER | 15.83 | — |
| AISHELL-4 Δcp | Δcp | 0.99 | — |
| Alimeeting CER | CER | 24.86 | — |
| Podcast CER | CER | 5.97 | — |
| Movies CER | CER | 6.36 | — |
이미지 분석

329
Likes
123.5k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.