본문으로 건너뛰기

lm-spt

LM-정렬 음성 토크나이저

LM-SPT는 음성을 의미 정보와 음향 정보를 분리해 토큰화하는 구조로, 초당 12.5프레임의 낮은 frame rate로 음성을 표현하도록 설계된 토크나이저입니다. 의미 토큰은 발화 내용을, 음향 토큰은 화자성과 억양·속도 같은 세부 특성을 담당하도록 Split RVQ 구조를 사용합니다. 이렇게 생성된 토큰을 단일 스테이지 디코더로 직접 waveform으로 복원해 디코딩 파이프라인을 간결하게 유지합니다.