TL;DR
Kanana‑o는 LM‑SPT라는 언어모델 친화적 토크나이저와 이를 활용한 Multi‑Codebook Voice Token LM, 그리고 반사실적 선호 데이터와 다중목표 온라인 강화학습을 결합해 실용적 음성 생성 효율성과 지시문 준수 능력을 동시에 끌어올렸다. LM‑SPT는 의미와 음향을 분리한 토큰 구조와 12.5Hz의 낮은 프레임레이트, 그리고 의미 재합성 증류로 낮은 토큰률에서도 의미 보존을 달성하며 단일 디코더로 빠른 파형 재구성을 가능하게 했다. 그 결과 자동 지표와 주관평가에서 경쟁 모델을 앞서고, 다중목표 온라인 RL 적용으로 InstructTTSEval에서 94.50을 기록해 사용자 지시문을 정밀하게 따르는 음성 합성이 실현되었다.
빠른 이해
새로운 점
이 글의 핵심 신호는 언어모델에 정렬된 낮은 프레임레이트 토크나이저(LM‑SPT)와, RVQ 기반의 다중 음향 코드북을 병렬로 생성하면서도 one‑step delay로 의존성을 유지하는 Multi‑Codebook Voice Token LM의 결합, 그리고 반사실적 선호 정렬을 활용해 지시문별 쌍별 선호를 학습한 뒤 다중목표 온라인 RL로 실제 생성 품질과 지시문 준수를 동시에 최적화한 점이다. 특히 의미 재합성 증류로 프레임레이트 불일치 문제를 회피해 의미 표현을 언어모델 수준으로 정렬한 접근과, InstructTTSEval에서 94.50을 달성한 온라인 RL 파이프라인은 기존 오프라인 DPO 방식과 구별되는 실무적 진전이다. 이런 요소들이 결합되어 낮은 토큰 수, 단일단계 디코더, 지시문 강도 제어를 동시에 달성하고 있다는 점이 새로움으로 작용한다.
핵심 메커니즘
Kanana‑o의 음성 생성 파이프라인은 먼저 대화 맥락으로부터 LLM 임베딩을 얻고 Voice Token LM이 프레임 단위로 의미 토큰과 여러 음향 토큰 스트림을 예측하는 구조로 동작한다. LM‑SPT는 각 프레임을 의미 토큰 하나와 다수의 음향 토큰으로 분해해 RVQ 방식으로 음향을 점진적으로 보완하고, 생성 단계에서는 의미 토큰을 우선 예측한 뒤 음향 코드북별로 한 스텝씩 지연을 부여해 이전 코드북 출력을 조건으로 삼아 다음 코드북을 병렬 예측하되 의존성을 유지한다. 최종적으로 LM‑SPT의 단일 디코더는 의미·음향 토큰을 입력으로 중간 멜 스펙트럼 없이 직접 파형을 복원해 디코딩 단계를 단순화하고, 학습은 의미 재합성 증류와 쌍별 선호 기반 Reward Model, 그리고 발음·화자·음질을 함께 고려하는 다중목표 온라인 RL을 통해 지시문 준수와 음성 품질을 균형 있게 향상시킨다.
핵심 수치
- LM‑SPT 한국어 ASR (clean CER): 11.9%- 표 1 기준, 비교 모델들 중 최저 CER
- LM‑SPT 디코더 파라미터 수: 40M- 단일 스테이지 디코더로 CosyVoice2(133M) 대비 파라미터 69% 감소
- LM‑SPT 디코딩 RTF: 0.005- 같은 조건에서 CosyVoice2(0.131) 대비 약 26배 빠름
- Kanana‑o 한국어 InstructTTSEval 점수: 94.50- 다중목표 온라인 RL 적용 후 결과, DPO(81.30) 대비 큰 개선
섹션별 상세
목표와 문제 정의
LM‑SPT의 구조와 학습 전략

- LM‑SPT는 프레임레이트를 12.5Hz로 낮추어 토큰 시퀀스 길이를 절반으로 줄였다. — LM‑SPT 설계 및 Kanana‑o 통합(섹션: LM‑SPT의 구조와 학습 전략, Kanana‑o 통합)에서 프레임레이트 수치와 설계의 목적을 기술한 부분을 근거로 함.
토크나이저 성능 및 디코딩 효율
- LM‑SPT 기반 SLM은 비교 대상 토크나이저에 비해 ASR 및 TTS 자동 지표에서 최저 오류율을 기록했다. — 표 1(ASR/TTS 성능 비교)을 근거로 하며, 표에서 LM‑SPT가 한국어·영어의 깨끗한/잡음 조건 모두에서 낮은 CER/WER를 기록한 행을 참고.
Kanana‑o 통합: 멀티 코드북 생성 전략
지시문 준수를 위한 학습: 반사실적 선호와 온라인 RL

- 다중목표 온라인 강화학습을 적용한 Kanana‑o는 한국어 InstructTTSEval 기준에서 94.50의 점수를 얻었다. — 성능 평가 섹션과 표(한국어 InstructTTSEval 점수 비교)를 근거로 함.
확장 방향과 실시간 응용
용어 해설
- 의미(semantic) 음성 토큰(Semantic speech tokens)
- — 의미 음성 토큰은 발화의 언어적 내용, 즉 문장과 대응되는 정보만을 압축해 표현하는 이산 토큰 체계이다. LM‑SPT에서는 이 토큰이 음성의 핵심 의미를 담아 언어모델이 대화 맥락에서 안정적으로 예측할 수 있도록 설계되어 있으며, 이는 고프레임레이트 교정 없이 강한 압축률에서도 발화 내용을 보존하도록 학습된다. 의미 토큰은 별도의 음향 토큰과 역할을 분리해 표현되므로 음성 생성 시 내용과 음색·억양 같은 비언어적 요소를 독립적으로 제어할 수 있다.
- 음향(acoustic) 음성 토큰(Acoustic speech tokens)
- — 음향 음성 토큰은 발화의 음색, 높낮이(pitch), 억양, 화자 특성, 발화 속도 등 세부적인 음성 특성을 표현하는 토큰 집합이다. LM‑SPT는 여러 개의 음향 코드북을 사용해 잔여 정보를 점진적으로 압축하는 RVQ 구조로 음향 토큰을 구성하여 의미 토큰과 결합하면 최종 파형을 직접 재구성할 수 있다. 음향 토큰의 계층적 구조는 제어 명령에 따른 세밀한 음성 조절을 가능하게 하며, 이를 통해 '조용히 읽기'나 '빠르게 읽기' 같은 사용자 스타일 지시를 토큰 단위로 반영할 수 있다.
- 잔여 벡터 양자화(RVQ)(Residual Vector Quantization (RVQ))
- — RVQ는 입력 특징을 여러 코드북으로 순차적으로 잔여 성분을 보완하며 양자화하는 기법으로, 첫 번째 코드북이 캡처하지 못한 정보를 다음 코드북이 점진적으로 인코딩한다. LM‑SPT에서는 의미 토큰과 별도로 여러 음향 코드북을 RVQ 형태로 배치해 초기 코드북은 거칠게, 이후 코드북은 세부적 특징을 보완하는 방식으로 토큰을 구성한다. 이 구조는 표현의 압축률을 높이면서도 세밀한 음향 재현을 가능하게 하고, 학습·생성 시 정보 의존성을 유지하기 위해 생성 순서에 지연 패턴을 적용한다.
- 의미 음성 재합성 증류(Semantic Speech‑Resynthesis Distillation)
- — 의미 음성 재합성 증류는 의미 토큰만으로 재합성한 음성을 원본 음성과 비교해, 음성 인코더 수준의 의미 표현이 보존되도록 학습시키는 방법이다. LM‑SPT는 기존의 프레임별 교사 특징 매칭 대신 이 방식으로 의미 토큰이 언어모델 수준의 고수준 의미를 유지하게 만들어 프레임레이트 불일치로 인한 정보 손실을 줄인다. 이렇게 하면 의미 토큰은 각 시점의 저수준 음향 특징을 그대로 모사할 필요 없이 문맥상 동일한 발화 내용을 담는 방향으로 최적화된다.
- 반사실적 선호 정렬(Counterfactual Preference Alignment)
- — 반사실적 선호 정렬은 평가 기준(예: '아주 빠르게 읽기')만 달라지게 만든 여러 발화 샘플을 동일 조건에서 비교해, 특정 지시문을 얼마나 잘 따르는지에 대해 쌍별 선호 데이터를 생성하는 기법이다. Kanana 팀은 같은 발화 내용과 화자를 유지한 상태에서 속도·볼륨 등 하나의 속성만 다르게 생성해 A>B, B>C 같은 쌍으로 확장된 학습 신호를 만들고, 이 신호로 Reward Model을 학습해 지시문 준수도를 평가하도록 했다. 이 접근은 보이스 특성이나 문장 분위기 같은 편향적 단서 대신 지시문 일치성에 대한 판별 능력을 강화한다.
- 다중목표 온라인 강화학습(Multi‑Objective Online Reinforcement Learning)
- — 다중목표 온라인 강화학습은 단일 보상 신호에만 의존하지 않고 발화의 지시문 준수, 발음 오류율, 화자 유사성, 음질 등 여러 목표를 동시에 고려해 모델을 업데이트하는 방법이다. Kanana‑o는 온라인으로 모델이 생성한 샘플을 재평가하고 그 결과를 학습 신호로 되돌려 지속적으로 개선하면서도 특정 목표(예: 속도 준수)에 치우쳐 음질이나 발음이 훼손되는 것을 방지하기 위해 이 다목표 방식을 사용했다. 각 목표는 별도의 지표로 측정되어 균형을 맞춘 업데이트가 이루어진다.
기술
- LM‑SPT
- Multi‑Codebook Voice Token LM
- Counterfactual Preference Alignment
- Multi‑Objective Online RL
- Kanana‑a
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.