ai-sage/GigaAM-Multilingual
Conformer 인코더를 HuBERT 유사 방식으로 2M 시간 학습하고 문자 단위 CTC로 50K 시간 파인튜닝해 러시아어·중앙아시아 언어에서 우수한 WER을 달성한 다국어 음성인식 모델이다.
학습 방식 · Conformer 기반 인코더를 HuBERT 유사 자기지도 목적함수로 2M 시간의 음성으로 사전학습한 뒤 문자 단위 CTC 디코더로 50K 시간 규모의 데이터로 파인튜닝해 ASR 출력 특화 모델을 얻었다. 사전학습은 다양한 언어를 포함한 대규모 코퍼스로 일반화 능력을 확보하는 데 초점을 두었고, 파인튜닝은 문자 단위 목표로 전사 품질을 개선하는 목적이었다. README는 backbone(ssl/large_ssl)과 파인튜닝된(ctc/large_ctc) 변종을 명확히 구분해 재사용과 추가 적응을 용이하게 했다.
TL;DR
GigaAM Multilingual은 Conformer 기반 인코더를 HuBERT 유사 자기지도 목표로 2M 시간의 음성 데이터로 사전학습하고 문자 단위 CTC로 50K 시간 규모를 파인튜닝해 만든 다국어 ASR 모델 계열이다. 220M과 600M 파라미터 변종을 제공하며 러시아어·카자흐어·키르기스어·우즈벡어에서 오픈소스 범주 내 높은 WER 성능을 보였고 영어에서는 중간 수준의 성능을 보였다. backbone(ssl/large_ssl)과 파인튜닝된(ctc/large_ctc) 변종이 분리되어 있어 새로운 언어 적응과 경량/고성능 선택이 용이하며 MIT 라이선스와 예제 노트북·fine-tuning 가이드를 통해 실무 적용과 추가 학습이 가능한 구조이다.
핵심 포인트
- 사전학습에 2M 시간이라는 대규모 다언어 코퍼스를 사용해 저자원 중앙아시아 언어에서의 표현력과 일반화 능력을 강화했다.
- Conformer 아키텍처와 HuBERT 유사 자기지도 학습 조합을 통해 시간·주파수 정보의 동시 모델링을 구현해 긴 발화에서도 견고한 특성 추출을 유지한다.
- 문자 단위 CTC로 파인튜닝된 변종을 별도 제공해 단순한 추론 인터페이스와 빠른 배포를 지원하며 backbone 재적응을 통한 언어 확장 워크플로우를 용이하게 했다.
- 러시아어·카자흐어·키르기스어·우즈벡어에서 오픈소스 범주 내에서 높은 품질을 보였고 이 지역 언어에 특화된 성능 우위를 확보했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| English (Common Voice) | WER (%) | 26.0 | vs Whisper large v3: 20.0; Seamless M4T large v2: 16.2 |
| English (FLEURS) | WER (%) | 12.2 | vs Whisper large v3: 3.9; Seamless M4T large v2: 5.8 |
| Russian (Common Voice) | WER (%) | 7.1 | vs GigaAM Multilingual Large: 5.1; Whisper large v3: 9.1 |
| Kazakh (Common Voice) | WER (%) | 17.2 | vs GigaAM Multilingual Large: 13.8; Whisper large v3: 57.8 |
| Uzbek (Common Voice) | WER (%) | 11.3 | vs GigaAM Multilingual Large: 9.2; Whisper large v3: 109.9 |
59
LIKES
2.9k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.