TL;DR
NVIDIA의 Magpie TTS Multilingual은 364M 파라미터의 오픈 가중치 다국어 TTS로 아랍어·한국어·브라질 포르투갈어를 포함한 12개 언어를 지원한다. 프레임 스태킹과 로컬 트랜스포머를 결합해 추론 반복 수를 줄이면서 음성 품질을 보존하고, 온프레미스 NVIDIA NIM 서빙에서 B200 기준 1스트림 TTFA 32ms 같은 낮은 지연을 기록해 실시간 음성 에이전트에 적합하다. 오픈 체크포인트와 NeMo 파인튜닝 경로, Nemotron Voice Agent 레퍼런스 아키텍처를 통해 기업이 자체 인프라에서 배포·튜닝·보안 통제를 실현할 수 있다.
섹션별 상세
- Magpie TTS Multilingual은 총 12개 언어를 지원하며 이번 릴리스에 Modern Standard Arabic, 한국어, 브라질 포르투갈어가 추가되었다. — 본문의 'One Open Model, Twelve Languages' 섹션과 릴리스 언어 목록
- 온프레미스 NVIDIA NIM 서빙 환경에서 B200 GPU는 1스트림 TTFA 32ms와 64스트림 동시 처리 시 239ms TTFA·320× RTFX 수치를 보였다. — 본문에 실린 NVIDIA TTS NIM Performance 문서(v26.07) 표의 GPU별 TTFA 및 RTFX 수치(온프레미스, 평균 3회 시행)

- 추론 속도 향상을 위해 Magpie는 프레임 스태킹과 로컬 트랜스포머를 결합한 아키텍처를 사용한다. — 본문의 'Optimized for Real-Time Speech Generation' 설명과 ICASSP 2026 논문 제목 언급
- 프랑스어와 스페인어에서 CER가 각각 2.70%→1.54%와 1.14%→0.60%로 개선되고 SSIM도 상승했다. — 본문의 'Faster Doesn't Matter If It Doesn't Sound Natural' 섹션에 제시된 언어별 CER·SSIM 표

용어 해설
- 최초 오디오 지연(Time to First Audio (TTFA))
- — TTFA는 음성 합성 요청이 시작된 시점부터 사용자에게 첫 오디오 프레임이 도달할 때까지의 지연을 뜻한다. 클라이언트-서버 왕복 시간이 없는 온프레미스 배포에서는 서버 사이드 최적화로 직접 단축할 수 있다. 대화형 에이전트에서 전체 응답 지연을 판단하는 핵심 지표로 사용된다.
- 실시간 처리 배수(RTFX)(RTFX (real-time factor ×))
- — RTFX는 모델이 재생 시간 대비 몇 배로 오디오를 생성하는지를 나타내는 지표로, 예컨대 300×는 재생 1초당 300초 분량의 오디오를 생성할 수 있음을 의미한다. 동시 스트림 부하 하에서 처리량을 비교할 때 유용하다. 높은 RTFX는 동시 사용자를 효율적으로 처리하는 능력을 보여준다.
- 프레임 스태킹(Frame stacking)
- — 프레임 스태킹은 디코더가 한 번의 반복에서 두 개 이상의 오디오 프레임을 예측하도록 해 디코더 반복 횟수를 줄이는 기법이다. 반복 수를 절반으로 낮춰 추론 시간을 단축하지만 토큰 간 의존성으로 품질이 저하될 수 있다. 이를 보완하기 위해 후속 처리 모델(예: local transformer)과 결합한다.
- 로컬 트랜스포머(Local transformer)
- — 로컬 트랜스포머는 동시에 생성된 코드북 토큰 사이의 의존성을 모델링해 프레임 스태킹으로 손상될 수 있는 음성 품질을 복원하는 역할을 한다. 생성된 오디오 토큰을 정교화하는 형태로 동작해 자연스러운 음색과 발음 유지를 돕는다. Magpie는 이 구조를 결합해 속도와 품질을 동시에 확보했다.
- NVIDIA NIM
- — NVIDIA NIM은 GPU에 최적화된 추론 컨테이너 스택으로, 동일 모델의 오픈 체크포인트와는 별도로 프로덕션 지연·처리량 기준을 달성하도록 튜닝된 서빙 환경을 제공한다. 온프레미스 GPU에서 수치화된 TTFA와 RTFX를 재현하도록 설계되어 있다. 개발자는 NIM을 통해 모델 서빙 성능을 직접 제어할 수 있다.
코드 예제
cfg_scale = 2.5 # classifier-free guidance
temperature = 0.6
top_k = 80
apply_attention_prior = True
prior_epsilon = 0.1모델 추론시 권장 설정 값으로, cfg_scale은 텍스트에 대한 응답 엄격도를 높이는 guidance 강도이고 temperature와 top_k는 샘플링의 다양성과 상한을 제어한다. apply_attention_prior와 prior_epsilon은 모델의 주의 가중치에 대한 사전 규제를 적용해 텍스트 준수성과 음성 품질 균형을 조정한다. 프로덕션 배포 전 자체 워크로드에서 수치 민감도를 벤치마크해 값을 튜닝해야 한다.
기술
- Magpie TTS Multilingual
- NVIDIA NIM
- NeMo
- Nemotron Speech
- Nemotron language models
- Hugging Face demo
활용 사례
- 글로벌 고객 지원용 실시간 음성 에이전트
- 헬스케어 보조 시스템의 의료 문서화 음성 출력
- 엔터프라이즈 동료 비서(enterprise copilots)에서의 즉시 음성 응답
- 실시간 번역 파이프라인과 혼합 언어 대화 처리
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.