본문으로 건너뛰기
TechCrunch AI조회 7

Cohere, 20억 파라미터 규모의 오픈소스 음성 인식 모델 'Transcribe' 출시

Cohere가 소비자용 GPU에서 구동 가능한 20억 파라미터 규모의 고성능 오픈소스 음성 인식 모델 'Transcribe'를 공개했다.

섹션별 상세

Cohere는 20억 파라미터 규모의 경량 자동 음성 인식(ASR) 모델인 'Transcribe'를 오픈소스로 공개했다. 이 모델은 사용자가 직접 호스팅할 수 있도록 소비자급 GPU 최적화에 중점을 두어 설계되었다. 한국어, 영어, 중국어 등 총 14개 주요 언어를 지원하며 회의록 작성 및 음성 분석 업무에 특화되어 있다.
성능 측면에서 Transcribe는 Hugging Face Open ASR 리더보드에서 평균 단어 오류율(WER) 5.42를 달성하며 업계 최고 수준을 기록했다. Zoom Scribe v1, IBM Granite 4.0 등 경쟁 모델과의 비교 벤치마크에서 우위를 점했으며, 인간 평가단 대상 정확도 및 가독성 테스트에서도 61%의 승률을 보였다. 다만 포르투갈어, 독일어, 스페인어 등 일부 언어에서는 경쟁 모델 대비 다소 낮은 성능을 보였다.
처리 속도는 1분당 최대 525분의 오디오 데이터를 처리할 수 있는 수준으로, 동급 모델 중 매우 높은 효율성을 자랑한다. Cohere는 이 모델을 자사의 기업용 에이전트 오케스트레이션 플랫폼인 'North'에 통합할 예정이며, 현재 API를 통해 무료로 제공하고 있다. 이는 최근 급증하는 Granola, Wispr Flow와 같은 음성 기반 생산성 도구 수요에 대응하기 위한 전략으로 풀이된다.

기술

  • Cohere Transcribe
  • Hugging Face Open ASR
  • North Platform
  • Model Vault

활용 사례

  • 회의록 자동 작성
  • 음성 데이터 분석
  • 받아쓰기 앱
  • 고객 센터 통화 기록 변환
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 26.수집 2026. 03. 27.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.