본문으로 건너뛰기

acoustic-speech-tokens

음향(acoustic) 음성 토큰

음향 음성 토큰은 발화의 음색, 높낮이(pitch), 억양, 화자 특성, 발화 속도 등 세부적인 음성 특성을 표현하는 토큰 집합이다. LM‑SPT는 여러 개의 음향 코드북을 사용해 잔여 정보를 점진적으로 압축하는 RVQ 구조로 음향 토큰을 구성하여 의미 토큰과 결합하면 최종 파형을 직접 재구성할 수 있다. 음향 토큰의 계층적 구조는 제어 명령에 따른 세밀한 음성 조절을 가능하게 하며, 이를 통해 '조용히 읽기'나 '빠르게 읽기' 같은 사용자 스타일 지시를 토큰 단위로 반영할 수 있다.