말한 그대로를 고정밀로 얻는 ASR
정확한 단어 타이밍과 verbatim 제어를 제공하는 CrisperWhisper 2.0 large
TL;DR
CrisperWhisper 2.0 large는 발화의 불유창성까지 선택적으로 보존하는 verbatim 모드와 사람이 읽기 좋은 intended 모드를 호출별로 제공하는 다국어 ASR 라이브러리입니다. supervised cross-attention을 정렬기로 감독해 읽기 발화에서 평균 단어 경계 오차 29.6 ms를 달성하고, verbatimize 워크플로로 클린 전사를 실제 오디오 불유창성으로 복원해 희귀어 재현율을 대폭 높입니다. 긴 오디오에 대해서는 conditional continuation으로 창 경계 중복·누락을 제거하고 CTranslate2 기반 speculative decoding과 루핑 억제 로직으로 배포 성능과 안정성을 동시에 확보합니다. Nyra Verbatim Speech Benchmark의 disfluency F1에서 표준 모델이 87.8, Pro 모델이 93.5를 기록한 점이 성능 우위를 뒷받침합니다.
핵심 역량
- verbatim·intended 모드 간 호출별 제어
- 단어 단위 시작·종료 타임스탬프 제공 (평균 경계 오차 ≈29.6 ms 읽기 발화)
- 긴 오디오를 중단 없이 처리하는 conditional continuation
- CTranslate2 기반 speculative decoding으로 추론 가속
- verbatimize로 기존 클린 전사를 실제 오디오 불유창성으로 업그레이드
강점
- 발화의 불유창성을 선택적으로 보존해 임상 분석과 TTS 데이터 준비에 적합하며, verbatim 모드는 불필요한 삽입을 억제하면서 실제 발화만 기록합니다. Verbatimize 워크플로우는 기존의 정돈된 코퍼스를 고품질 verbatim 데이터로 변환해 데이터 확장 비용을 낮춥니다. 이는 희귀어나 고유명사 재현율을 크게 개선하는 실증적 결과로 이어집니다.
- 단어 단위 타이밍 정확도가 높아 정밀한 타임스탬프가 필요한 자막·정렬·포렌식 분석 작업에 이점이 있습니다. 읽기 발화에서 평균 경계 오차 약 29.6 ms를 달성했고, 대화체에서도 41 ms 수준의 성능을 유지합니다. supervised attention을 정렬기로 활용한 접근이 세밀한 타이밍 산출을 가능하게 했습니다.
- 실전 배포를 고려한 추론 성능과 안정성을 함께 제공하며, CTranslate2 및 speculative decoding으로 추론 속도를 1.3–1.4x 개선하는 옵션이 존재합니다. 루핑형 허구 생성에 대한 자동 억제 로직을 포함해 긴 오디오에서 반복 오류를 줄였습니다. 또한 compute_type 옵션으로 float16·int8_float16 양자화가 지원되어 배포 유연성이 큽니다.
훈련 방식
Whisper의 cross-attention 정렬 성질을 감독해 단어 경계 정밀도를 끌어올리고, verbatim·intended 스타일 제어를 다국어에 걸쳐 학습하도록 설계했습니다. 일부 Pro 모델은 추가적인 사유 데이터와 hotword 부스팅으로 성능을 더한 반면, 표준 모델은 공개·비상업적 라이선스 하에서 재현 가능성을 높였습니다. 평가와 개선은 Nyra Verbatim Speech Benchmark의 typed disfluency 지표와 정렬 관련 연구를 통해 구체적인 수치로 검증했습니다.
알아두면 좋은 것
- 발화에 실제로 존재하는 채움말·반복·끊김·음성 이벤트만 보존하는 verbatim 모드와 가독성 높은 intended 모드를 호출별로 전환할 수 있습니다.
- 단어 경계 평균 오차는 읽기 발화에서 29.6 ms, 대화체에서 41 ms로, 저지연 단어 타임스탬프가 필요할 때 유리합니다.
- Verbatimize 기능은 오디오와 신뢰된 클린 전사를 입력받아 희귀어 재현율을 6.8%에서 96.1%로 개선하는 사례를 보고합니다.
- CTranslate2 런타임에서 speculative decoding과 루핑 허구 억제를 적용해 실전 배포 추론을 더 빠르고 안정적으로 만듭니다.
기술적 특징
- supervised cross-attention alignment을 도입해 attention 기반의 경계 예측을 감독함으로써 단어 시작·종료 시점을 추출합니다. 입력 오디오와 정답 경계를 매칭해 attention 헤드를 정렬기로 사용하고, 이 방식이 TIMIT 등 읽기 발화에서 평균 29.6 ms의 경계 오차를 가능하게 했습니다.
- conditional continuation으로 긴 오디오를 창 단위로 처리할 때 앞서 전사된 단어들을 컨텍스트로 조건화하여 다음 창을 시작함으로써 창 경계에서 중복 또는 누락이 발생하지 않도록 합니다. 따라서 타임스탬프 기반의 취약한 스티칭 대신 단어 단위 연속성을 보장합니다.
- CTranslate2 런타임과 speculative decoding 조합으로 작은 초안 모델이 토큰을 제안하고 대형 모델이 이를 검증하는 구조를 적용해 같은 출력 질에서 추론 속도를 1.3–1.4x 개선합니다. 이 파이프라인은 실전 환경에서 레이턴시를 낮추고 자원 효율을 개선하는 데 기여합니다.
차별점
- 발화의 불유창성(채움말·반복·중단·음성 이벤트)을 typed metric으로 평가하는 Nyra Verbatim Speech Benchmark에서 상위권을 기록해 verbatim 전사 품질을 수치로 입증했습니다. 평균 disfluency F1은 표준 모델에서 87.8, Pro 모델에서 93.5를 기록해 경쟁 제품 대비 우위를 보였습니다.
- verbatimize 워크플로로 클린 전사를 실제 오디오 불유창성으로 복원함으로써 기존 코퍼스를 verbatim 데이터로 대규모 전환할 수 있는 실용적 파이프라인을 제공합니다. 이 방법이 희귀어 재현율을 극적으로 개선한 사례가 공개되어 데이터 확보 전략에 실질적 이점을 줍니다.
- 긴 오디오 처리에서 conditional continuation과 루핑 억제 로직을 결합해 창 경계의 중복·누락·루핑 허구 문제를 동시에 줄이는 통합적 접근을 채택했습니다. 이는 팟캐스트나 회의 녹음처럼 장시간 오디오를 안정적으로 전사해야 하는 서비스에 직접적인 이점을 제공합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Nyra Verbatim Speech Benchmark — Disfluency F1 (10 lang avg) | Disfluency F1 | 87.8 | — |
| Word-timing accuracy on read speech (TIMIT) | Mean boundary error | 29.6 ms | — |
53
Likes
1.8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.