본문으로 건너뛰기

semantic-speech-resynthesis-distillation

의미 음성 재합성 증류

의미 음성 재합성 증류는 의미 토큰만으로 재합성한 음성을 원본 음성과 비교해, 음성 인코더 수준의 의미 표현이 보존되도록 학습시키는 방법이다. LM‑SPT는 기존의 프레임별 교사 특징 매칭 대신 이 방식으로 의미 토큰이 언어모델 수준의 고수준 의미를 유지하게 만들어 프레임레이트 불일치로 인한 정보 손실을 줄인다. 이렇게 하면 의미 토큰은 각 시점의 저수준 음향 특징을 그대로 모사할 필요 없이 문맥상 동일한 발화 내용을 담는 방향으로 최적화된다.