Conformer 기반으로 2M시간 사전학습하고 50K시간 CTC로 파인튜닝된 다국어 ASR 모델 계열
Conformer 인코더를 HuBERT 유사 방식으로 2M 시간 학습하고 문자 단위 CTC로 50K 시간 파인튜닝해 러시아어·중앙아시아 언어에서 우수한 WER을 달성한 다국어 음성인식 모델이다.
TL;DR
GigaAM Multilingual은 Conformer 기반 인코더를 HuBERT 유사 자기지도 목표로 2M 시간의 음성 데이터로 사전학습하고 문자 단위 CTC로 50K 시간 규모를 파인튜닝해 만든 다국어 ASR 모델 계열이다. 220M과 600M 파라미터 변종을 제공하며 러시아어·카자흐어·키르기스어·우즈벡어에서 오픈소스 범주 내 높은 WER 성능을 보였고 영어에서는 중간 수준의 성능을 보였다. backbone(ssl/large_ssl)과 파인튜닝된(ctc/large_ctc) 변종이 분리되어 있어 새로운 언어 적응과 경량/고성능 선택이 용이하며 MIT 라이선스와 예제 노트북·fine-tuning 가이드를 통해 실무 적용과 추가 학습이 가능한 구조이다.
핵심 역량
- 다수 언어의 음성 입력을 문자 시퀀스로 전사할 수 있으며 러시아어·카자흐어·키르기스어·우즈벡어에서 특히 높은 정확도를 보인다.
- 220M 및 600M 파라미터 변종을 제공해 리소스 제약에 따른 선택지가 가능하며 SSL(backbone)과 CTC 파인튜닝된 추론 모델을 구분해 사용자가 용도에 맞게 선택할 수 있다.
- 사전학습과 파인튜닝 단계가 분리되어 있어 backbone을 새로운 언어로 적응시키는 Fine-tuning 워크플로우가 지원된다.
강점
- 러시아어·카자흐어·키르기스어·우즈벡어에서 오픈소스 범주 내에서 높은 품질을 보였고 이 지역 언어에 특화된 성능 우위를 확보했다.
- 2M 시간 규모의 다언어 사전학습과 50K 시간 파인튜닝이라는 대규모 학습 집합을 통해 저자원 언어에 대한 일반화가 강화되어 실제 환경의 다양한 발화에 견고하다.
- 모델 계열로서 ssl 백본과 ctc 파인튜닝 변종을 분리 제공해 연구자와 엔지니어가 backbone을 다른 데이터로 재적응시키거나 경량 변종을 선택하는 유연성이 있다.
훈련 방식
Conformer 기반 인코더를 HuBERT 유사 자기지도 목적함수로 2M 시간의 음성으로 사전학습한 뒤 문자 단위 CTC 디코더로 50K 시간 규모의 데이터로 파인튜닝해 ASR 출력 특화 모델을 얻었다. 사전학습은 다양한 언어를 포함한 대규모 코퍼스로 일반화 능력을 확보하는 데 초점을 두었고, 파인튜닝은 문자 단위 목표로 전사 품질을 개선하는 목적이었다. README는 backbone(ssl/large_ssl)과 파인튜닝된(ctc/large_ctc) 변종을 명확히 구분해 재사용과 추가 적응을 용이하게 했다.
알아두면 좋은 것
- GigaAM Multilingual은 Conformer 기반 인코더를 사용하며 220M과 600M 두 변종으로 제공되어 경량 모델과 대형 모델을 모두 지원한다.
- 사전학습은 HuBERT 유사 목적으로 총 2M 시간의 음성을 사용했고, 이후 문자 단위 CTC 디코더를 이용해 50K 시간으로 파인튜닝해 ASR 성능을 확보했다.
- README에 제시된 벤치마크는 Common Voice, FLEURS, 내부 in-the-wild 테스트셋을 사용했으며 발화 길이와 숫자 포함 기준을 명확히 필터링한 상태에서 greedy decoding으로 평가했다.
- 라이선스는 MIT이며 README는 러시아어·영어·카자흐어·키르기스어·우즈벡어 언어를 나열하고 관련된 fine-tuning 가이드와 예제 노트북 링크를 제공한다.
기술적 특징
- 사전학습 방식은 HuBERT 유사 목표를 사용해 무라벨 음성으로부터 잠재 표현을 학습했다. 이 절차는 음성의 구조적 특징을 비지도 방식으로 잡아내며 downstream ASR로의 전이 성능을 향상시켰다. 2M 시간이라는 대규모 코퍼스 사용은 특히 저자원 언어에서의 발음·어휘 다양성 학습에 기여했다.
- 모델 아키텍처는 Conformer 기반 인코더를 사용해 지역적 주파수 패턴을 합성곱으로, 장기적 문맥을 self-attention으로 처리한다. 이 결합은 연속 음성 신호의 시간-주파수 특성을 동시에 포착해 프레임 기반 특성 표현을 정교화한다. 결과적으로 긴 발화에서도 안정적인 특징 추출이 가능하다.
- 출력층 설계는 문자 단위 CTC 디코더로 프레임별 문자 확률을 직접 예측하도록 구성되어 있으며, 별도의 언어 모델 없이도 빠른 greedy decoding으로 전사를 산출한다. 이 접근은 추론단에서 연산적 부담을 낮추면서 문자 단위 전사 일관성을 제공한다. README의 평가 설정은 정규화와 필터링을 거쳐 CTC 기반 전사의 품질을 비교 가능한 형태로 유지했다.
- 모델 계열은 220M과 600M 두 파라미터 규모로 나뉘어 리소스 제약 환경과 고성능 요구 환경을 모두 수용한다. 백본(ssl/large_ssl)과 파인튜닝된(ctc/large_ctc) 변종 구분은 연구자가 backbone을 재활용해 새로운 언어로 적응시키는 실용적 워크플로우를 지원한다. 관련 가이드와 예제 노트북이 README에서 연결되어 있어 재학습·적응 절차를 따르기 용이하다.
차별점
- 사전학습에 2M 시간이라는 대규모 다언어 코퍼스를 사용해 저자원 중앙아시아 언어에서의 표현력과 일반화 능력을 강화했다.
- Conformer 아키텍처와 HuBERT 유사 자기지도 학습 조합을 통해 시간·주파수 정보의 동시 모델링을 구현해 긴 발화에서도 견고한 특성 추출을 유지한다.
- 문자 단위 CTC로 파인튜닝된 변종을 별도 제공해 단순한 추론 인터페이스와 빠른 배포를 지원하며 backbone 재적응을 통한 언어 확장 워크플로우를 용이하게 했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| English (Common Voice) | WER (%) | 26.0 | vs Whisper large v3: 20.0; Seamless M4T large v2: 16.2 |
| English (FLEURS) | WER (%) | 12.2 | vs Whisper large v3: 3.9; Seamless M4T large v2: 5.8 |
| Russian (Common Voice) | WER (%) | 7.1 | vs GigaAM Multilingual Large: 5.1; Whisper large v3: 9.1 |
| Kazakh (Common Voice) | WER (%) | 17.2 | vs GigaAM Multilingual Large: 13.8; Whisper large v3: 57.8 |
| Uzbek (Common Voice) | WER (%) | 11.3 | vs GigaAM Multilingual Large: 9.2; Whisper large v3: 109.9 |
59
Likes
2.9k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.