본문으로 건너뛰기

비언어적 발성에서의 화자 정체성: 조건부 증류와 Mixture of Experts 기반 접근

TTS·VC 시스템이 웃음·기침 등 비언어적 발성을 생성할 때 화자 정체성 일관성 검증이 필요하다. 기존 SV 모델은 NVV에서 성능 저하가 심하고, NVV로 파인튜닝하면 modal speech 성능이 크게 손실된다. 본 연구는 NVV 전반에 걸친 실험과 함께 도메인 분리와 조건부 증류로 이 문제를 해결함으로써 실용적 자동화 검증 가능성을 제공한다.

용어 해설

Data2Vec
모달리티에 무관하게 연속 잠재 표현을 예측하는 self-supervised 학습 방식이다. 입력 신호의 프레임 수준 표현을 학습된 연속 타깃과 비교·예측함으로써 클러스터 기반의 이산화(phoneme clustering) 병목을 회피하고, 비음성(non-verbal) 음향에서도 연속 표현을 제공해 downstream SV에서 더 나은 일반화 성능을 보인다.
ECAPA-TDNN
다중 스케일 컨볼루션과 채널 어그리게이션을 사용하는 스피커 임베딩 백엔드 구조이다. 프레임 단위 특징을 집계하여 고정 차원(예: 192-d) 임베딩을 생성하고, 짧은 NVV와 장시간 발화의 시간적 특성을 모두 포착하도록 설계되어 스피커 검증에 널리 사용된다.
Mixture of Experts(Mixture of Experts (MoE))
입력 특징을 라우터(gating)로 여러 전문가(expert) 네트워크 중 일부에 할당하고, Top-K 가중합으로 출력하는 구조이다. 본 논문에서는 speech/NVV 도메인 분리를 위해 IR-MoE를 Transformer 블록 후에 삽입해 도메인별 전문화를 유도한다.
조건부 지식 증류 손실(Conditional Distillation Loss)
배치 내 발화 타입(예: speech)에 따라 pretrained teacher의 임베딩과 student 임베딩의 코사인 거리를 계산하는 손실이다. speech 샘플에만 적용해 modal speech 성능을 유지하면서 NVV 적응을 허용한다.
Supervised Contrastive Loss
동일 화자 샘플을 positive로 묶고 다른 화자를 negative로 취해 임베딩 간 유사도를 최적화하는 손실이다. 본 작업에서는 cross-domain(speech-NVV) positive 쌍을 포함해 화자 정체성의 도메인 간 공유를 강제한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 19.수집 2026. 06. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.