본문으로 건너뛰기

Vividh-ASR: 강건한 Indic 음성 인식을 위한 Complexity-Tiered 벤치마크 및 최적화 다이나믹스

대규모 사전학습 기반의 다언어 ASR에서 저자원 언어의 spontaneous 음성에 대한 성능 저하가 흔하다. 본 연구는 복잡도에 따라 Tier를 나눈 Vividh-ASR 벤치마크와 학습률 타이밍 및 커리큘럼 방향의 상호작용을 평가하여, 초기 대규모 업데이트가 엔코더의 음향 기하를 거의 손상시키지 않으면서 디코더를 재구성하도록 하는 학습 전략(R-MFT)을 제시한다. 이를 통해 244M Whisper 모델이 769M 대비 경쟁하거나 우수한 성능을 달성할 수 있음을 보이며, 스튜디오-바이어스(studio-bias) 문제를 해결하는 방향을 제시한다.

용어 해설

CKA(Centered Kernel Alignment)(CKA)
CKA는 신경망 계층 간 활성화 맵의 유사성을 비교해 표현 공간의 구조를 정량화하는 지표다. 본 연구에서 base Whisper와 fine-tuned 모델 간 활성화 기하학의 보존 여부를 평가하는 도구로 사용된다.
SVD(Singular Value Decomposition)(SVD)
SVD는 행렬의 특이값 분해를 통해 차원 축소 및 주요 구성요소를 파악하는 기법이다. 본 연구에서는 encoder/decoder 활성화 분포의 차원적 변화 분석에 활용된다.
Wasserstein-1 거리(Earth Mover's Distance)(Wasserstein-1 EMD)
EMD는 확률분포 간의 차이를 측정하는 거리로, encoder/decoder 활성화 분포의 drift를 정량화하는 데 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 13.수집 2026. 05. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.