52개 언어 지원 및 상용 API급 성능을 갖춘 1.7B 초경량 SOTA 음성 인식 모델
자동 음성 인식 (ASR), 언어 식별 (LID), 강제 정렬 (Forced Alignment)1.7Bapache-2.0
한국어를 포함한 52개 언어/방언을 지원하며 실시간 스트리밍과 정밀 타임스탬프 추출이 가능한 고성능 ASR 모델입니다.
핵심 역량
- 한국어 포함 52개 언어 및 방언 인식 지원
- 실시간 스트리밍 및 오프라인 배치 추론 통합 지원
- vLLM 기반 초고속 추론 (128 동시성 기준 2000배 처리량)
- 노래 및 배경음악이 포함된 복잡한 오디오 처리 가능
- 단어/문자 단위 정밀 타임스탬프 예측 (Forced Aligner 연동)
- 긴 오디오 파일에 대한 안정적인 전사 능력
알아두면 좋은 것
- 오픈소스 ASR 모델 중 SOTA 달성 및 상용 API 수준의 성능 경쟁력 확보
- 한국어(ko)를 포함한 30개 주요 언어 및 22개 중국어 방언 공식 지원
- vLLM 백엔드 지원으로 대규모 배치 처리 및 비동기 서빙 최적화
- Forced Aligner 모델을 통한 5분 이내 오디오의 정밀한 텍스트-음성 정렬
522
Likes
478.6k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.