실시간 스트리밍 TTS 성능과 NISQA 자연도 1위 달성 모델
텍스트가 도착하는 즉시 프레임 단위로 오디오를 생성하는 Qwen3.5 기반의 실시간 자기회귀 TTS로서 높은 자연성과 낮은 지연을 목표로 한다.
TL;DR
Gepard는 Qwen3.5 기반의 자기회귀 텍스트-투-스피치 모델로 텍스트가 도착하는 즉시 프레임 단위로 오디오를 생성해 실시간 대화에서 낮은 지연과 자연스러운 리듬을 목표로 설계되었다. FSQ 기반의 프레임 샘플링과 NVIDIA NeMo NanoCodec을 결합하고 CFG 정제 효과를 가중치에 내재화해 단일 패스에서 높은 NISQA-MOS 점수를 달성함으로써 자연도 측면에서 우수함이 확인되었다. vLLM 경로에서는 단일 RTX 5090으로 약 25× 실시간 처리와 첫 오디오 청크 약 50 ms를 기록하며 고메모리 GPU에서는 수백 동시 대화까지 확장 가능하다. 다만 화자 유사도와 단어 정확도는 일부 경쟁 모델보다 낮게 나타나 스트리밍 우선의 설계가 품질 지표별 트레이드오프를 만들어낸다.
핵심 역량
- Gepard는 텍스트가 도착하는 즉시 프레임 단위로 오디오를 생성해 첫 오디오 청크를 약 50 ms 내에 출력함으로써 사람과의 대화에서 실시간 응답성을 제공한다. 이 모델은 프레임 전체(32 orthogonal FSQ 채널)를 한 스텝으로 샘플링하는 설계로 지연을 줄이고 연속성 있는 리듬과 타이밍을 유지한다. 실시간 스트리밍과 배치 합성 모두 지원해 대화형 에이전트와 콘텐츠 보이스오버 용도에 모두 사용할 수 있다.
- 해당 모델은 몇 초 길이의 레퍼런스 오디오만으로 화자 특성을 추출해 음성 클로닝을 수행하며, 클로닝 단계가 별도의 단어별 비용을 추가하지 않아 장시간 대화에서 비용과 지연 부담을 최소화한다. 클로닝은 초기 참조 캡처로 동작해 이후 합성 과정에서 동일한 파이프라인으로 화자 특성을 재활용한다. 이 접근은 다양한 목적으로 빠르게 맞춤 음성을 생성하는 워크플로를 가능하게 한다.
- 모델은 영어(미국·영국 억양), 스페인어(멕시코), 포르투갈어(브라질), 네덜란드어를 포함한 다언어 출력을 지원하며 일부 영어 방언을 별도로 제공해 억양과 발음 특성을 반영한다. 다국어 처리는 단일 학습된 언어-음성 모델로 이루어져 텍스트와 음성 특징을 함께 학습한 결과로 자연스러운 억양을 생성한다. 언어별 품질 편차와 음성별 성능 차이는 문서에서 명시되어 있다.
- vLLM 기반 경로를 통해 고처리량 실시간 추론을 지원해 단일 RTX 5090에서 약 25배 실시간 처리량을 달성하며, 고메모리 GPU에서는 수백 동시 대화를 운영할 수 있다. 문서에 따르면 96GB GPU 한 대에 최대 256개의 동시 대화를 수용할 수 있어 스케일 아웃 부담을 줄인다. PyTorch 참조 러너는 행위 일관성의 기준이지만 속도 튜닝은 vLLM 경로에서 제공된다.
강점
- 공개 벤치마크에서 Gepard는 NISQA-MOS 지표에서 최고 점수(4.25)를 기록해 주관적 자연도 측면에서 우위를 보였으며 잡음과 색채감, 불연속성 지표에서도 상위 성능을 나타냈다. 이러한 결과는 FSQ 기반 프레임 샘플링과 CFG 정제의 가중치 내재화가 실시간 제약 하에서도 음질을 유지하는 데 기여했음을 시사한다. 실시간 처리 성능과 낮은 초기 출력 대기시간은 대화형 서비스에서 체감 품질을 올리는 강점으로 작용한다.
- 실시간 처리 측면에서 문서에 제시된 수치는 단일 RTX 5090에서 약 25× 실시간 처리와 첫 오디오 청크 TTFA 약 50 ms로, 응답성 요구가 높은 대화 시스템에 적합한 성능 프로파일을 보여준다. 추가로 고메모리 GPU 한 대로 수백 개 동시 대화를 수용할 수 있다는 점은 운영적 확장성에서 장점으로 작용한다. 다만 이러한 수치는 vLLM 기반 최적화 경로에서 측정된 것으로, PyTorch 참조 러너는 동일한 속도 특성을 보장하지 않는다.
- 라이선스가 Apache-2.0으로 비교적 관대하고 기술보고서 및 데모, 추론·학습 리포지토리가 공개되어 있어 연구와 상용화 초기 실험에 적합한 접근성을 제공한다. 다국어 지원과 단기 레퍼런스로 가능한 음성 클로닝 기능은 다양한 응용에서 빠른 프로토타입 제작을 가능하게 한다. 반면 화자 유사도와 단어 정확도에서의 낮은 수치는 특정 애플리케이션에서 고려할 트레이드오프로 남는다.
훈련 방식
기반 모델은 nineninesix/qwen3_5-full-attn-only-14로서 Qwen3.5 계열의 full-attention transformer를 텍스트-음성 결합 목적에 맞춰 미세조정(finetune)한 형태이다. 학습에는 laion/Emolia 데이터셋이 사용되었고 텍스트와 오디오를 함께 학습해 억양과 타이밍을 모델 내부에서 동시 표현하도록 구성되었다. 이 접근은 별도 텍스트-오디오 파이프라인 없이도 자연스러운 스트리밍 합성을 달성하기 위해 채택되었다.
알아두면 좋은 것
- Gepard는 텍스트와 음성을 하나의 모델로 함께 학습해 합성 음성의 리듬과 타이밍을 자연스럽게 유지하도록 설계되었으며, 이 때문에 기존 파이프라인처럼 문장을 완전히 준비한 뒤 연결하는 방식보다 더 생동감 있는 대화형 출력을 만든다. 모델은 자기회귀(decoder-only) 구조를 기반으로 하고 Qwen3.5 계열 백본을 미세조정한 형태로 구축되어 있다. 이러한 통합 학습 접근은 실시간 대화에서 억양과 타이밍의 일관성을 높이는 역할을 한다.
- 문서에 따르면 오디오 프레임 하나를 한 번의 샘플링 스텝으로 처리하는 'one clean pass per frame' 설계가 지연을 줄이는 핵심 기법이며, 이를 위해 32개의 직교 FSQ 채널을 사용해 프레임을 표현한다. CFG 정제 기능이 가중치에 내장되어 단일 패스에서 추가 품질을 얻을 수 있으며 필요 시 전통적 두 패스 모드를 품질 다이얼로 선택할 수 있다. 이 설계는 실시간 제약 안에서 품질과 지연의 트레이드오프를 제어하는 수단을 제공한다.
- 성능 측정에서 Gepard는 Seed-TTS-eval 벤치마크에 따라 NISQA-MOS에서 최고 점수(4.25)를 기록했으며 잡음, 색채감, 불연속성 지표에서 우수한 정성적 특성을 보였다. 반면 화자 유사도(SIM)와 단어 정확도(WER)는 일부 다른 모델에 비해 낮은 값을 보였는데 문서에서는 스트리밍 우선 설계와 속도 최적화가 이 수치에 영향을 준 것으로 표기하고 있다. 따라서 실시간 자연도와 낮은 지연이 우선인 애플리케이션에서 특히 적합하다.
- 라이선스는 Apache-2.0이며 오디오 코덱은 NVIDIA NeMo NanoCodec을 사용해 FSQ 기반의 22.05 kHz 샘플링, 21.5 fps, 1.89 kbps 전송 특성을 가진다. 문서에서 vLLM 경로와 PyTorch 참조 러너를 구분해 제시하고 있어 실제 배포에서는 vLLM 최적화된 실행 경로를 권장한다. 기술보고서와 데모 스페이스, 추론 및 트레이닝 리포지토리 링크가 공개되어 있어 재현과 배포 작업의 참고 자료가 제공된다.
기술적 특징
- Gepard의 오디오 생성은 한 프레임을 단 한 번의 샘플링 스텝으로 처리하는 설계를 사용해 프레임 내부의 32 orthogonal FSQ 채널을 동시에 샘플링한다. 이 방식은 전통적 깊은 트랜스포머 패스의 반복을 제거해 계산 지연을 줄이며 실시간 스트리밍에서 낮은 TTFA를 얻는 데 기여한다. 결과적으로 부분 출력이 더 빠르게 생성되어 대화형 응답성이 개선된다.
- 문서에 따르면 Classifier-Free Guidance 정제 기능이 모델 가중치에 내재되어 단일 패스에서도 품질 향상을 얻을 수 있으며 필요 시 기존의 두 패스 모드로 전환해 품질을 더 높이는 다이얼을 제공한다. 가중치 내재화는 실시간 환경에서 두 패스 비용 없이 정제 효과를 얻도록 설계된 절충으로, 품질과 지연 사이의 제어점을 제공한다. 두 패스 모드는 품질 우선 상황에서 선택적으로 사용될 수 있다.
- Gepard는 텍스트와 음성을 하나의 모델로 동시 학습해 억양과 타이밍 정보를 내부적으로 캡처하도록 구성되어, 합성 음성에서 더 자연스러운 리듬과 타이밍을 생성한다. 이는 별도 TTS 파이프라인에서 흔히 발생하는 부자연스러운 연결감과 평면적인 음색 문제를 완화하는 데 효과적이다. 통합 학습은 대화형 상황에서의 연속성 유지에 특히 유리하다.
- 실행 측면에서는 vLLM 최적화 경로에서 단일 RTX 5090 기준 약 25배 실시간 처리와 약 50 ms의 첫 오디오 청크 지연을 기록해 실시간 응답성 목표를 달성했다. 또한 96GB급 GPU 한 대에서 최대 256 동시 대화 운영이 가능하다고 문서에 명시돼 있어 대규모 동시 접속 시나리오에서도 메모리 효율과 처리량을 고려한 설계가 반영되었다. PyTorch 레퍼런스 러너는 기능적 기준선을 제공하지만 고처리량 운영은 vLLM 패스가 권장된다.
- 음향 인코딩은 NVIDIA NeMo NanoCodec의 FSQ 기반 포맷을 사용해 22.05 kHz 샘플링과 21.5 fps 프레임 레이트로 작동하며 전송 비트레이트는 1.89 kbps로 명시되어 있다. 이 코덱 선택은 네트워크 및 저장 비용을 낮추면서도 청취 가능한 품질을 유지하려는 설계적 타협의 결과다. 코덱은 모델 설계와 함께 스트리밍 성능을 달성하는 데 핵심적인 역할을 한다.
차별점
- Gepard는 텍스트 입력이 도착하는 즉시 프레임 단위로 오디오를 생성하는 스트리밍 우선 설계로 낮은 초기 응답 지연을 달성해 대화형 에이전트에서의 체감 응답성을 우선시한다. 이 접근은 전체 문장을 기다리는 배치 합성 방식과 달리 부분 출력부터 재생해 실시간 인터랙션을 가능하게 한다. 실시간 우선 설계로 인해 일부 화자 유사도나 단어 정확도에 대한 트레이드오프가 발생할 수 있다.
- 모델은 CFG 정제 효과를 가중치에 내재화해 전형적 두 패스 정제 비용 없이도 단일 패스에서 향상된 음질을 제공하며 필요시 두 패스 모드로 더 높은 품질을 선택할 수 있는 품질 다이얼을 갖추고 있다. 이로 인해 실시간 제약 하에서도 품질을 제어할 수 있는 유연성이 확보되었다. 가중치 내재화는 실시간 환경에서의 추가 연산 부담을 줄이는 설계 선택이다.
- 오디오 포맷과 실행 경로 전반에서 FSQ 기반 NanoCodec과 vLLM 최적화를 결합해 낮은 대역폭, 낮은 초기 지연, 그리고 높은 동시 처리량을 동시에 달성하려는 설계 철학을 반영했다. 이 통합된 시스템 접근은 단일 모델로 텍스트와 음성을 함께 학습한 점과 맞물려 스트리밍 음성 합성의 운영 효율성을 높인다. 결과적으로 음질과 처리량을 동시에 고려한 균형점을 제공한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Gepard 1.0 | WER | 0.036 | vs VoxCPM2 (WER 0.015) |
| Gepard 1.0 | SIM | 0.585 | lower than several baselines listed |
| Gepard 1.0 | UTMOS | 2.64 | — |
| Gepard 1.0 | NISQA-MOS | 4.25 | highest among listed models |
| Gepard 1.0 | NOI | 4.16 | top score among listed models |
| Gepard 1.0 | COL | 4.16 | top score among listed models |
| Gepard 1.0 | DIS | 4.51 | top score among listed models |
106
Likes
5.9k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.