TL;DR
카카오의 Kanana-o 개선은 LM-SPT라는 언어모델 정렬형 토크나이저와 Counterfactual Preference 기반의 온라인 multi-objective 강화학습을 결합해 실현되었습니다. LM-SPT는 의미 토큰(VQ)과 음향 토큰(RVQ)을 분리하고 frame rate를 초당 12.5로 낮춰 Voice Token LM의 생성 시퀀스를 절반으로 줄였으며, 단일 스테이지 디코더로 RTF 0.005를 달성해 실시간 디코딩 효율을 크게 개선했습니다. 발화지시 이행은 같은 화자·문장 조건에서 지시 강도만 다르게 만든 counterfactual preference로 보상모델을 학습하고, 온라인 단계에서 지시 이행 점수·발화 오류율·화자 유사도·음질을 함께 최적화해 InstructTTSEval에서 94.50을 기록하는 등 실용적 지시 제어 능력을 확보했습니다.
빠른 이해
새로운 점
의미 토큰과 음향 토큰을 분리하고 frame rate를 12.5Hz로 낮춘 LM-SPT는 단일 스테이지 디코더로 직접 waveform을 복원해 디코딩을 간결화했으며, Counterfactual Preference 기반의 온라인 multi-objective RL로 발화지시 이행력을 대폭 개선했습니다.
핵심 메커니즘
LM-SPT는 의미(VQ)와 음향(RVQ) 코드북을 분리해 의미 정보와 음향 정보를 구조적으로 나누어 토큰화합니다. 학습 단계에서는 의미 토큰만으로 음성을 재합성한 뒤 언어모델 친화적 인코더로 원본·재합성 음성의 의미 표현을 정렬해 높은 수준의 의미 보존을 확보합니다. 운영 단계에서는 Multi-codebook Voice Token LM이 코드북별 출력 헤드를 통해 병렬 예측을 수행하되 RVQ 의존성을 반영하는 1-step delay를 적용해 효율과 정확도를 동시에 확보하고, 생성된 토큰을 단일 디코더로 바로 waveform으로 복원합니다.
핵심 수치
- Encoder parameters: 32M- LM-SPT 인코더 파라미터 수
- Korean ASR (clean CER ↓): 11.91- KSponSpeech clean 환경에서의 문자 오류율
- Korean ASR (noisy CER ↓): 11.37- KSponSpeech noisy 환경에서의 문자 오류율
- English ASR (clean WER ↓): 3.39- LibriSpeech clean 환경에서의 단어 오류율
- English ASR (noisy WER ↓): 11.21- LibriSpeech noisy 환경에서의 단어 오류율
- Zero-shot TTS (Korean CER ↓): 6.64- TTS로 합성한 한국어 문장에 대한 문자 오류율
- Zero-shot TTS (English WER ↓): 1.48- TTS로 합성한 영어 문장에 대한 단어 오류율
- Decoder RTF (Real-Time Factor ↓): 0.005- LM-SPT 단일 스테이지 디코더의 디코딩 속도
- InstructTTSEval (Kanana-o, online RL): 94.50- multi-objective 온라인 강화학습 적용 후의 한국어 지시 이행 스코어
섹션별 상세
글 개요와 목표
기존 토크나이저의 한계
LM-SPT 설계 핵심
- LM-SPT는 기존 대비 frame rate를 절반으로 줄여 Voice Token LM의 생성 시퀀스 길이를 줄였다. — 본문의 LM-SPT 설계 설명과 그림 3, '초당 12.5프레임' 언급
의미 정렬을 위한 증류 방법

성능 비교와 증거
- LM-SPT 디코더는 RTF 0.005를 기록해 CosyVoice2 대비 약 26배 빠른 디코딩 속도를 보였다. — 디코딩 속도 비교 표(Decoder Params·RTF)와 관련 문단
Kanana-o에의 통합 구조

발화지시 이행 학습 방법
지표 기반 결과와 향후 과제
용어 해설
- LM-정렬 음성 토크나이저(LM-SPT)
- — LM-SPT는 음성을 의미 정보와 음향 정보를 분리해 토큰화하는 구조로, 초당 12.5프레임의 낮은 frame rate로 음성을 표현하도록 설계된 토크나이저입니다. 의미 토큰은 발화 내용을, 음향 토큰은 화자성과 억양·속도 같은 세부 특성을 담당하도록 Split RVQ 구조를 사용합니다. 이렇게 생성된 토큰을 단일 스테이지 디코더로 직접 waveform으로 복원해 디코딩 파이프라인을 간결하게 유지합니다.
- 의미 토큰(Semantic Speech Token)
- — 의미 토큰은 음성의 언어적 내용, 즉 텍스트와 대응되는 발화 정보를 압축해 표현하는 토큰입니다. LM-SPT에서는 사전 학습된 언어모델 친화적 인코더(예: Whisper 유사)를 활용한 의미-재합성(distillation)으로 의미 보존을 강화했습니다. 의미 토큰만으로도 원본 발화 내용을 재현하도록 학습해 언어모델과의 정렬을 개선합니다.
- 음향 토큰(Acoustic Speech Token)
- — 음향 토큰은 화자 음색, 억양, 음높이, 발화 속도 등 음성의 비언어적·하위정보를 표현하는 토큰입니다. LM-SPT에서는 여러 개의 음향 코드북을 RVQ 방식으로 구성해 앞단 코드북이 표현하지 못한 잔여 음향 정보를 뒤쪽 코드북이 순차적으로 보완합니다. 이렇게 의미 토큰과 병렬 조합하면 언어모델이 음성의 세부 특성을 토큰 수준에서 제어할 수 있습니다.
기술
- LM-SPT
- Voice Token LM
- Multi-codebook Voice Token LM
- Counterfactual Preference Alignment
- Online Reinforcement Learning
- DPO
- Whisper
- HuBERT
- WavLM
- RVQ
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.