facebook/mms-300m
다국어 음성 표현 학습 및 Fine-tuning 기반 Automatic Speech Recognition300 millionCC-BY-NC 4.0
500,000시간 음성으로 1,400개 이상 언어를 사전학습한 300M 파라미터 Wav2Vec2 모델
학습 방식 · Wav2Vec2 self-supervised training objective와 약 500,000시간의 1,400개 이상 언어 음성 데이터를 사용한 사전학습
TL;DR
facebook/mms-300m은 약 500,000시간의 음성 데이터를 1,400개 이상 언어에서 학습한 300M 파라미터 규모의 multilingual speech 사전학습 모델이다. Wav2Vec2의 self-supervised training objective로 원시 음성에서 언어 공통 표현을 익히며, 입력 음성은 16kHz 샘플링을 요구한다. Automatic Speech Recognition, Translation, Classification 같은 downstream task에 Fine-tuning해 사용하는 기반 모델이다. 다국어 음성 처리 애플리케이션의 초기 음성 encoder로 활용할 수 있지만, README에는 사전학습 모델 자체의 성능 수치가 없다.
핵심 포인트
- Wav2Vec2의 self-supervised objective로 원시 음성에서 다국어 표현을 학습한 기반 모델입니다.
- 약 500,000시간의 음성 데이터와 1,400개 이상 언어를 활용해 사전학습했습니다.
- 음성 입력은 16kHz 샘플링이 필요하며, 다른 샘플링 속도는 사용 전 변환해야 합니다.
- ASR·Translation·Classification 같은 downstream task에 Fine-tuning하는 용도입니다.
제한사항
- 사전학습 모델이므로 Automatic Speech Recognition, Translation, Classification 등 downstream task별 Fine-tuning이 필요합니다.
- 음성 입력 샘플링 속도는 16kHz로 맞춰야 합니다.
126
LIKES
12.8k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.