용어 해설
- Data2Vec
- — 모달리티에 무관하게 연속 잠재 표현을 예측하는 self-supervised 학습 방식이다. 입력 신호의 프레임 수준 표현을 학습된 연속 타깃과 비교·예측함으로써 클러스터 기반의 이산화(phoneme clustering) 병목을 회피하고, 비음성(non-verbal) 음향에서도 연속 표현을 제공해 downstream SV에서 더 나은 일반화 성능을 보인다.
- ECAPA-TDNN
- — 다중 스케일 컨볼루션과 채널 어그리게이션을 사용하는 스피커 임베딩 백엔드 구조이다. 프레임 단위 특징을 집계하여 고정 차원(예: 192-d) 임베딩을 생성하고, 짧은 NVV와 장시간 발화의 시간적 특성을 모두 포착하도록 설계되어 스피커 검증에 널리 사용된다.
- Mixture of Experts(Mixture of Experts (MoE))
- — 입력 특징을 라우터(gating)로 여러 전문가(expert) 네트워크 중 일부에 할당하고, Top-K 가중합으로 출력하는 구조이다. 본 논문에서는 speech/NVV 도메인 분리를 위해 IR-MoE를 Transformer 블록 후에 삽입해 도메인별 전문화를 유도한다.
- 조건부 지식 증류 손실(Conditional Distillation Loss)
- — 배치 내 발화 타입(예: speech)에 따라 pretrained teacher의 임베딩과 student 임베딩의 코사인 거리를 계산하는 손실이다. speech 샘플에만 적용해 modal speech 성능을 유지하면서 NVV 적응을 허용한다.
- Supervised Contrastive Loss
- — 동일 화자 샘플을 positive로 묶고 다른 화자를 negative로 취해 임베딩 간 유사도를 최적화하는 손실이다. 본 작업에서는 cross-domain(speech-NVV) positive 쌍을 포함해 화자 정체성의 도메인 간 공유를 강제한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

