본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nyralabs/CrisperWhisper2.0_large

자동 음성 인식(ASR) — verbatim/intended 선택 가능한 단어 단위 타임스탬프 전사Nyra Health Non-Commercial Research License (상업적 이용은 별도 라이선스 필요)

Nyra Labs의 CrisperWhisper 2.0은 verbatim(있는 그대로)과 intended(의도한 문장) 두 모드를 선택할 수 있는 단어 단위 타임스탬프 ASR로 10개 언어 disfluency F1에서 최고 점수를 기록했다.

TL;DR

CrisperWhisper 2.0은 '음', 반복, 말 끊김 같은 비유창성(disfluency)을 있는 그대로 받아 적는 verbatim 모드와 사람이 의도한 깔끔한 문장으로 정리하는 intended 모드를 명시적으로 선택할 수 있는 음성 인식 모델로, 같은 녹음에서 두 종류의 전사를 모두 낼 수 있다. 읽기 음성에서 평균 약 30ms, 대화 음성에서 약 41ms의 단어 경계 오차로 가장 정밀한 단어 단위 타임스탬프를 제공하며, 10개 언어 평균 disfluency F1에서 87.8점(Pro 버전은 93.5점)으로 ElevenLabs Scribe v2(79.2)·Microsoft MAI-Transcribe-1.5(77.5) 등 비공개 경쟁 시스템을 앞섰다. Verbatimize 기능으로 오디오와 깨끗한 스크립트만 있으면 실제로 발화된 비유창성만 삽입해 재전사보다 정확하게 검증된 verbatim 전사를 만들 수 있고(희귀어 재현율 6.8%→96.1%), conditional continuation으로 30초 이상 긴 오디오도 청크 경계에서 단어가 겹치거나 빠지지 않게 이어 붙인다. CTranslate2 런타임과 추정적 디코딩으로 Whisper 특유의 반복 환각도 기본으로 억제한다.

핵심 포인트

  • verbatim(있는 그대로)/intended(의도한 문장) 두 모드를 명시적으로 선택할 수 있어 같은 오디오에서 두 종류의 전사를 모두 얻는다.
  • 10개 언어 평균 disfluency F1 87.8(Pro 93.5)로 ElevenLabs Scribe v2(79.2) 등 비공개 시스템을 앞섰다.
  • Verbatimize 기능으로 기존 깨끗한 스크립트에 실제 발화된 비유창성만 삽입해 대량의 클린 코퍼스를 verbatim 데이터로 전환할 수 있다.
  • conditional continuation으로 긴 오디오를 청크 경계 손실 없이 잇고, CTranslate2 런타임이 반복 환각을 기본 억제한다.

제한사항

  • 표준 모델은 비상업적 연구용 라이선스이며 상업적 이용에는 별도 계약이 필요하다.
  • hotword 편향 부스팅은 Pro 모델에서만 제공된다.

벤치마크

벤치마크지표비교
Disfluency F1 (10개 언어 평균)F187.8ElevenLabs Scribe v2 79.2, MS MAI-Transcribe-1.5 77.5
단어 경계 오차(TIMIT)ms29.6xAI Grok Speech-to-Text 37.1

84

LIKES

6.8k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.