용어 해설
- 교차 규모 지식 증류(Cross-Scale Distillation)
- — 서로 다른 크기와 은닉 차원을 가진 Teacher와 Student 사이에서 중간 표현과 출력 분포를 전달하는 방법입니다. 이 논문에서는 24개 Audio Encoder 층과 2048차원 은닉 상태를 가진 Qwen3-ASR-1.7B가 14·16층, 1024차원 Student의 표현과 Logit을 감독합니다. 이를 통해 단순한 자기 증류보다 강한 복원 신호를 얻습니다.
- 행동 기반 Probe(Behavioral Probe)
- — 특정 층을 제거한 후보 모델을 짧은 동일 조건으로 복구한 뒤 실제 음성 인식 오류율을 측정하는 선별 절차입니다. 개별 층의 정적 중요도 대신 여러 층을 함께 제거했을 때의 복구 가능성을 직접 비교하므로 층 간 비가산적 상호작용을 반영합니다.
- 전사 일관성(Transcript Consistency)
- — 원본 전사와 두 외부 ASR 시스템의 가설 사이에서 문자 또는 단어 편집률을 비교해 학습 데이터의 일치 수준을 분류하는 기준입니다. 중국어에는 CER, 영어에는 WER을 사용하며, 두 가설과 원문이 모두 정확히 일치하는 Class 1을 복원 학습에 사용합니다.
- Student-Policy 증류(Student-Policy Distillation)
- — Teacher가 정답 접두어만 받는 대신 Student가 실제로 생성한 토큰 접두어를 함께 입력받아 두 모델의 다음 토큰 분포를 맞추는 증류 방식입니다. X-AuT는 Stage 1의 20%가 지난 뒤 매 다섯 번째 Optimizer 단계에서 이를 적용하고, 비정상 Rollout은 Teacher-forced 학습으로 되돌립니다.
- 공유 출력 임베딩(Tied Output Embedding)
- — Decoder 입력 Token Embedding과 출력 lm_head가 동일한 가중치를 공유하는 구조입니다. X-AuT는 Stage 0·1에서 이 공유 출력을 학습시켜 pruned Audio Encoder가 만든 새로운 조건부 표현에 맞는 Token 분포를 조정하고, Stage 2에서는 해당 가중치를 고정합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



