본문으로 건너뛰기

CPU 환경에서 Pocket TTS 포함 6종 TTS 모델의 RTF와 UTMOS를 활용한 벤치마크 공유

Intel Xeon CPU에서 Pocket TTS를 포함한 여섯 TTS 모델의 실시간 계수와 UTMOS 기반 품질 점수를 비교한 정량적 벤치마크와 아키텍처별 관찰을 제시한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

이 게시물은 Intel Xeon CPU 환경에서 Pocket TTS를 포함한 여섯 TTS 모델을 동일한 프로토콜로 측정하여 RTF와 UTMOS 기반 품질 점수를 비교한 벤치마크 결과를 공유한다. 벤치마크는 Pocket TTS가 출력 길이에 대해 0.69–0.76의 평탄한 RTF를 보이며 스트리밍 LM 아키텍처가 고정 오버헤드를 제거해 긴 텍스트에서 지연 예측에 유리하다는 사실을 보여주고, UTMOS는 작은 보코더 계열에 대해 '깨끗함'을 과대평가할 수 있어 NISQA나 청취 평가 병행이 필요하다는 관찰을 포함한다. 또한 Inflect-Nano의 max_frames 설정으로 인한 출력 상한이 비교를 왜곡했고 ONNX와 PyTorch의 상대 성능이 CPU 아키텍처에 따라 뒤바뀌는 현상이 확인되어 다양한 실리콘에서의 재검증이 권장된다. 화자 클로닝 능력은 Pocket TTS만의 기능으로 별도 스피커 유사성 평가지표가 필요하며 본 벤치마크의 한계로 단일 하드웨어·영어 전용·UTMOS 단일 지표 사용·비배치 추론 미검증을 명시하고 있다.

실용적 조언

  • 자동 MOS 지표를 사용할 때는 보코더 유형과 모델의 스펙트럼 특성을 함께 표기하고, 가능하면 인간 청취 평가나 NISQA 같은 자연스러움 특화 지표를 병행하여 해석해야 한다.
  • 모델별로 합성 길이 제한이나 내부 구성(max_frames 등)을 사전에 확인하여 비교 가능한 입력 길이 범위를 설정하면 긴 입력에서의 오해를 줄일 수 있다.
  • CPU 기반 벤치마크는 단일 실리콘 결과에 의존하지 말고 여러 마이크로아키텍처에서 재현 실험을 수행하여 ONNX/PyTorch 같은 런타임 선택이 플랫폼별로 달라질 수 있음을 반영해야 한다.

섹션별 상세

01
스트리밍 언어모델 기반 TTS는 출력 길이에 비례하는 일정한 처리 속도로 동작하여 입력 길이에 따른 고정 오버헤드가 거의 없다. Pocket TTS는 오토리그레시브로 오디오 토큰을 일정 속도로 방출하기 때문에 RTF가 텍스트 길이 범위에서 0.69에서 0.76으로 평탄하게 유지되며, 이는 긴 대화나 상호작용형 시스템에서 최악 지연(worst-case latency) 예측을 단순하게 만든다. 비교 대상인 Kokoro PyTorch는 짧은 입력에서 0.49에서 긴 입력에서 0.83으로 상승했고 Supertonic은 반대로 긴 입력에서 낮아지는 경향을 보여 고정 호출 오버헤드와 출력 처리 방식 차이가 성능 프로파일을 결정했다. 이 관찰은 실무에서 대기 시간 예산 수립이나 SLA 설계 시 스트리밍 출력 특성이 중요한 고려사항임을 의미한다.
02
자동 MOS 예측기인 UTMOS는 작은 보코더 계열에 대해 평가 편향을 보이며 보청상 청감과 일치하지 않는 경우가 발생했다. Inflect-Nano-v1은 UTMOS 기준으로 3.48로 중간 수준에 위치하지만 청감상으로는 바즈(띠소리)하고 로보틱한 특징이 뚜렷하여 UTMOS가 HiFi-GAN 계열처럼 '깨끗한' 스펙트럼을 보상하는 경향이 있다. Pocket TTS는 UTMOS 4.10을 기록했으나 청감상으로는 자연스러운 리듬과 억양을 유지했기 때문에 단일 자동 점수로는 '청결함'과 '자연스러움'을 구분하기 어렵다. 따라서 자동 MOS와 함께 인간 청취 평가 또는 자연스러움 특화 지표(NISQA 등)를 병행해야 품질 비교의 해석 가능성이 높아진다.
03
Inflect-Nano-v1은 내부 구성으로 max_frames = 1400 설정이 있어 출력 길이에 약 14.93초 상한을 가지며 이로 인해 긴 입력에서의 RTF와 처리량 수치가 실제보다 과대평가될 수 있다. 벤치마크는 이 모델을 긴 입력군에서도 동일하게 측정했으나 저자는 해당 모델의 합리적 비교 범위를 짧고 중간 길이로 제한해야 한다고 지적했다. 이 제한은 모델 구성 자체가 합성 작업량을 인위적으로 줄여 다른 모델들과의 일대일 비교를 왜곡하므로, 재현 가능하고 공정한 비교를 위해 모델별 작동 한계와 설정을 사전에 정리해야 한다. 결과적으로 모델별 config와 실행 상한을 명확히 표시하지 않으면 멀티모델 벤치마크의 해석에 오류가 발생한다.
04
같은 코드라도 CPU 마이크로아키텍처에 따라 ONNX Runtime과 PyTorch의 상대 성능이 뒤바뀌는 현상이 관찰되었다. 이전 AMD EPYC 플랫폼에서는 PyTorch가 ONNX보다 빠르게 측정되었으나 Intel Xeon 8272CL 플랫폼에서는 ONNX가 PyTorch보다 약간 우세(0.641 vs 0.665)한 것으로 보고되었으며 저자는 커널 최적화와 CPU별 라이브러리 차이가 실제 성능 순위를 뒤바꿀 수 있다고 보았다. 이 사실은 CPU 상에서의 TTS 추론 성능을 일반화하기 어렵게 만들며 벤치마크를 설계할 때 다양한 실리콘에서 반복 측정하는 것이 중요하다는 실무적 결론을 도출한다. ARM이나 다른 CPU 계열에서의 재현 결과가 있으면 추가 비교가 유용하다.
05
Pocket TTS는 약 5초 분량의 레퍼런스 오디오로 제로샷 화자 클로닝이 가능하다는 점에서 다른 비교 대상 모델들과 기능적 차별점이 존재한다. 벤치마크는 속도와 평균 품질 점수를 공정하게 비교하기 위해 Pocket TTS를 고정 프리셋 음성으로 고정했기 때문에 화자 클로닝 능력은 수치에 반영되지 않았다. 이로 인해 RTF와 MOS만으로는 한 모델이 제공하는 고유한 기능성을 포착할 수 없으며, 스피커 유사성(speaker-similarity)이나 화자 클로닝 전용 평가지표를 별도로 도입해야 기능 비교의 공정성이 확보된다. 따라서 단일 축(RTF·MOS) 비교만으로는 모델 선택 결정을 완결할 수 없다.

용어 해설

실시간 계수(Real-Time Factor (RTF))
입력 길이에 대해 합성 시간이 상대적으로 얼마나 걸리는지를 나타내는 지표로, 합성 오디오 길이 대비 처리 시간 비율을 계산하여 모델의 지연과 처리 비용 특성을 비교하는 데 사용된다.
평균 주관 평가 점수(Mean Opinion Score (MOS))
여러 청취자가 음성 합성의 자연스러움이나 품질을 주관적으로 평가한 평균값으로, 객관적 자동 예측기와 병행하면 음질과 자연스러움의 차이를 더 잘 포착할 수 있다.
스트리밍 언어 모델(Streaming LM)
오디오 토큰을 자기회귀적으로 일정한 속도로 출력하는 아키텍처로, 입력 길이와 무관하게 출력 길이에 비례해 비용이 선형으로 증가하면서 고정 오버헤드가 거의 없어 긴 텍스트에서 지연 예측이 용이하다.
보코더(Vocoder)
모델이 생성한 스펙트럼이나 임베딩을 실제 오디오 파형으로 변환하는 구성요소로, 합성기의 세부 음색과 노이즈 특성에 결정적 영향을 미쳐 MOS 기반 자동 평가에서 과대·과소평가를 초래할 수 있다.
NISQA
음성 품질의 자연스러움과 왜곡을 정량화하도록 설계된 자동 지표로, 특히 인간주의적 자연스러움 평가가 필요한 경우 UTMOS와 병행해 보완적 근거를 제공할 수 있다.

언급된 도구

ONNX Runtime중립

CPU에서 모델을 실행하는 추론 런타임

PyTorch중립

모델 학습과 CPU 추론 모두에 사용된 딥러닝 프레임워크

UTMOS중립

저장된 WAV 파일에 대해 자동 MOS를 예측하는 평가기

NISQA추천

음성의 자연스러움·품질을 정량화하는 대체 자동 지표

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 07.수집 2026. 07. 07.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.