TL;DR
TTS·VC 시스템이 웃음·기침 등 비언어적 발성을 생성할 때 화자 정체성 일관성 검증이 필요하다. 기존 SV 모델은 NVV에서 성능 저하가 심하고, NVV로 파인튜닝하면 modal speech 성능이 크게 손실된다. 본 연구는 NVV 전반에 걸친 실험과 함께 도메인 분리와 조건부 증류로 이 문제를 해결함으로써 실용적 자동화 검증 가능성을 제공한다.
왜 중요한가
TTS·VC 시스템이 웃음·기침 등 비언어적 발성을 생성할 때 화자 정체성 일관성 검증이 필요하다. 기존 SV 모델은 NVV에서 성능 저하가 심하고, NVV로 파인튜닝하면 modal speech 성능이 크게 손실된다. 본 연구는 NVV 전반에 걸친 실험과 함께 도메인 분리와 조건부 증류로 이 문제를 해결함으로써 실용적 자동화 검증 가능성을 제공한다.
핵심 기여
10가지 NVV 타입에 대한 체계적 평가
NonverbalTTS 데이터셋의 10개 NVV 카테고리에 대해 zero-shot 및 파인튜닝된 SV 모델 성능을 대규모로 평가했다. NVV에서의 도메인 격차와 스피치 성능 붕괴 현상을 정량적으로 제시했다.
조건부 지식 증류 손실(Conditional Distillation)
배치 내 speech 샘플에만 frozen teacher(WavLM 기반) 임베딩과의 코사인 거리 손실을 적용해 speech 임베딩 구조를 유지하면서 NVV 적응을 허용했다. 이 방식으로 SvS EER을 13.17%에서 9.24%로 회복시켰다(논문 Table 3).
Inter-Layer Residual MoE (IR-MoE) 설계
Data2Vec 프론트엔드와 ECAPA-TDNN 백엔드 사이에 레이어별 MoE 어댑터를 삽입해 speech와 NVV에 대해 서로 다른 전문가 경로를 학습시켰다. 4-expert 구성에서 NvS EER을 22.66%로 최소화했다(논문 Table 1·Figure 3).
도메인 인식 라우팅 제약과 supervised contrastive 통합
배치 수준 load-balancing, 이벤트별 EMA 라우팅 프로토타입을 이용한 intra-event KL 제약, 이벤트 간 코사인 마진(inter-event) 제약을 도입해 라우터의 붕괴 방지와 전문가 분화를 강제했다. 또한 SupCon을 통해 화자 정체성의 도메인 간 공유를 확보했다.
실험·훈련 파이프라인 공개
코드베이스(https://github.com/wiizzz/nonverbal-sv)를 공개해 NonverbalTTS 기반 실험 재현과 추가 연구를 가능하게 했다.
핵심 아이디어 이해하기
출발점과 기존 한계: 현재 강력한 SV 파이프라인은 SSL(front-end) + ECAPA-TDNN(back-end) 조합을 사용해 modal speech에서 우수한 성능을 보인다. 그러나 NVV는 음소 기반 구조가 약하거나 없고 스펙트럼·시간적 특성이 다양해 동일한 표현 공간에서 처리하면 same-speaker와 different-speaker score 분포가 크게 겹쳐 검증 성능이 급락한다(Zero-shot NvS EER 38.93%). 또한, NVV 데이터로 단순 파인튜닝하면 modal speech 성능이 파괴되는 catastrophic forgetting이 관찰된다.
방법론
전체 접근과 핵심 아이디어: 입력 오디오에서 frozen Data2Vec로 프레임 단위 연속 표현을 추출하고, 그 출력을 ECAPA-TDNN으로 전달해 최종 스피커 임베딩을 생성한다. 중간에 Inter-Layer Residual MoE(IR-MoE)를 삽입해 Transformer 블록 후 각 단계에서 전문가(expert) 어댑터를 적용하고, 라우터는 TopK(softmax(W_g h), k)로 k=2 선택을 수행한다. 최종 임베딩은 AAM-Softmax, MoE 관련 제약(ℒ_MoE), conditional distillation(ℒ_Dist), supervised contrastive(ℒ_SupCon)을 결합한 다중 목적 함수로 학습된다.
관련 Figure

다이어그램은 IR-MoE와 Post-Fusion MoE 두 설계의 구조적 차이를 시각적으로 제시한다. IR-MoE는 각 Transformer 블록 후에 전문가 어댑터와 잔차 합성을 수행해 계층별 도메인 분리를 허용하며, Post-Fusion은 최종 가중합 후 단일 MoE를 적용해 late adaptation을 수행한다. 또한 conditional distillation(teacher) 경로와 손실 구성(ℒ_Spk, ℒ_MoE, λ_Distℒ_Dist, λ_SupConℒ_SupCon)이 함께 표시되어 학습 파이프라인의 전체 흐름 이해에 직접적으로 기여한다.
제안된 전체 파이프라인 다이어그램: frozen Data2Vec → MoE(Inter-Layer 또는 Post-Fusion) → ECAPA-TDNN → 스피커 임베딩 및 다중 목적 손실 구성을 보여준다.
주요 결과
메인 벤치마크 성능: Table 1 기준으로 zero-shot wavlm-base-plus-sv는 SvS EER 5.60%이나 NvS/NvN EER는 각각 38.93%/39.13%로 큰 성능 저하를 보였다. Data2Vec+ECAPA-TDNN는 단독 최적 baseline으로 NvS EER 23.33%를 기록했다. 제안 방법(IR-MoE + conditional distillation)은 NvS EER을 22.66%로 낮추고 SvS EER을 9.24%로 회복했다.
관련 Figure

이 플롯은 NVV(특히 vocal bursts)와 speech 간 코사인 분포가 크게 겹치며, 동일 화자와 다른 화자 점수 분포의 구분이 약해지는 점을 보여준다. 이 근거는 NVV에서의 zero-shot 성능 저하(예: NvS EER 38.93%)와 모델이 도메인별 분리를 필요로 하는 근거로 직접 연결된다.
cosine similarity 분포 플롯: speech vs vocal-burst 등 다양한 조건에서 same/non-target 분포의 겹침을 시각화했다.
기술 상세
전체 아키텍처 구조: 입력 오디오 → frozen Data2Vec(프레임 표현) → IR-MoE 어댑터(각 Transformer 블록 후 삽입) 또는 Post-Fusion MoE(가중 합 후 단일 MoE) → ECAPA-TDNN(프레임 집계, 192-d 임베딩) → AAM-Softmax 및 SupCon 기반 학습. MoE는 per-frame routing을 수행해 도메인별 전문가로 분기한다.
한계점
논문에서 언급된 한계는 다음과 같다. (1) SvS 성능은 여전히 VoxCeleb2로 학습된 큰 모델(예: wavlm-base-plus-sv, SvS EER 5.60%)보다 낮으며, 이 격차를 데이터 규모 차이(NonverbalTTS 17시간 vs 대규모 공개 코퍼스)로 설명하고 있다. (2) 데이터 불균형(Breath가 전체의 67% 이상)과 전체 훈련 시간의 제한으로 인해 전문가 수를 무한정 늘릴 수 없으며, 전문가 수가 증가할 경우 특정 전문가 당 샘플 부족으로 NvS 성능이 악화될 수 있다.
실무 활용
TTS/VC 시스템에서 생성된 비언어적 발성의 화자 일관성 자동 검증 파이프라인에 적용 가능하다. 공개된 코드로 NonverbalTTS 기반 재현이 가능하다.
- Expressive TTS/VC에서 합성 NVV의 화자 일관성 평가 자동화
- 데이터셋 수집 파이프라인에서 NVV 별 화자 라벨 품질 검사
- 스피치 인증 시스템의 비언어 입력(기침, 웃음) 허용성 테스트
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- Data2Vec
- — 모달리티에 무관하게 연속 잠재 표현을 예측하는 self-supervised 학습 방식이다. 입력 신호의 프레임 수준 표현을 학습된 연속 타깃과 비교·예측함으로써 클러스터 기반의 이산화(phoneme clustering) 병목을 회피하고, 비음성(non-verbal) 음향에서도 연속 표현을 제공해 downstream SV에서 더 나은 일반화 성능을 보인다.
- ECAPA-TDNN
- — 다중 스케일 컨볼루션과 채널 어그리게이션을 사용하는 스피커 임베딩 백엔드 구조이다. 프레임 단위 특징을 집계하여 고정 차원(예: 192-d) 임베딩을 생성하고, 짧은 NVV와 장시간 발화의 시간적 특성을 모두 포착하도록 설계되어 스피커 검증에 널리 사용된다.
- Mixture of Experts (MoE)
- — 입력 특징을 라우터(gating)로 여러 전문가(expert) 네트워크 중 일부에 할당하고, Top-K 가중합으로 출력하는 구조이다. 본 논문에서는 speech/NVV 도메인 분리를 위해 IR-MoE를 Transformer 블록 후에 삽입해 도메인별 전문화를 유도한다.
- Conditional Distillation Loss
- — 배치 내 발화 타입(예: speech)에 따라 pretrained teacher의 임베딩과 student 임베딩의 코사인 거리를 계산하는 손실이다. speech 샘플에만 적용해 modal speech 성능을 유지하면서 NVV 적응을 허용한다.
- Supervised Contrastive Loss
- — 동일 화자 샘플을 positive로 묶고 다른 화자를 negative로 취해 임베딩 간 유사도를 최적화하는 손실이다. 본 작업에서는 cross-domain(speech-NVV) positive 쌍을 포함해 화자 정체성의 도메인 간 공유를 강제한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.