acoustic-speech-token
음향 토큰
음향 토큰은 화자 음색, 억양, 음높이, 발화 속도 등 음성의 비언어적·하위정보를 표현하는 토큰입니다. LM-SPT에서는 여러 개의 음향 코드북을 RVQ 방식으로 구성해 앞단 코드북이 표현하지 못한 잔여 음향 정보를 뒤쪽 코드북이 순차적으로 보완합니다. 이렇게 의미 토큰과 병렬 조합하면 언어모델이 음성의 세부 특성을 토큰 수준에서 제어할 수 있습니다.
음향 토큰
음향 토큰은 화자 음색, 억양, 음높이, 발화 속도 등 음성의 비언어적·하위정보를 표현하는 토큰입니다. LM-SPT에서는 여러 개의 음향 코드북을 RVQ 방식으로 구성해 앞단 코드북이 표현하지 못한 잔여 음향 정보를 뒤쪽 코드북이 순차적으로 보완합니다. 이렇게 의미 토큰과 병렬 조합하면 언어모델이 음성의 세부 특성을 토큰 수준에서 제어할 수 있습니다.