본문으로 건너뛰기

NVIDIA Magpie 다국어 TTS와 NIM 기반 배포

오픈 가중치 Magpie TTS로 자체 인프라에 다국어 저지연 음성 합성 배포가 가능하다

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

NVIDIA의 Magpie TTS Multilingual은 364M 파라미터의 오픈 가중치 다국어 TTS로 아랍어·한국어·브라질 포르투갈어를 포함한 12개 언어를 지원한다. 프레임 스태킹과 로컬 트랜스포머를 결합해 추론 반복 수를 줄이면서 음성 품질을 보존하고, 온프레미스 NVIDIA NIM 서빙에서 B200 기준 1스트림 TTFA 32ms 같은 낮은 지연을 기록해 실시간 음성 에이전트에 적합하다. 오픈 체크포인트와 NeMo 파인튜닝 경로, Nemotron Voice Agent 레퍼런스 아키텍처를 통해 기업이 자체 인프라에서 배포·튜닝·보안 통제를 실현할 수 있다.

섹션별 상세

NVIDIA의 Magpie TTS Multilingual은 364M 파라미터의 오픈 가중치 다국어 음성 합성 모델로 영어·스페인어·프랑스어 등 기존 언어에 Modern Standard Arabic, 한국어, 브라질 포르투갈어를 추가해 총 12개 언어를 지원한다. 각 언어는 남성·여성 화자를 공유하는 멀티링구얼 스피커 표현을 통해 제공되며, 힌디·일본어의 코드스위칭 지원을 IPA 기반 그래페메-투-포닉스 처리와 사용자 사전으로 확장했다. 단일 오픈 모델로 여러 지역·혼합 언어 콘텐츠를 처리할 수 있어 별도 지역별 TTS 모델을 운용할 필요를 줄인다.
근거
  • Magpie TTS Multilingual은 총 12개 언어를 지원하며 이번 릴리스에 Modern Standard Arabic, 한국어, 브라질 포르투갈어가 추가되었다. 본문의 'One Open Model, Twelve Languages' 섹션과 릴리스 언어 목록
지연 관점에서 Magpie는 Time to First Audio(TTFA)를 핵심 성능 지표로 삼고 있으며, 온프레미스 NVIDIA NIM 서빙 환경에서 GPU별로 1스트림 TTFA가 32ms(B200)에서 79ms(A100) 범위로 보고되었다. 동시 64스트림 부하에서는 B200이 239ms TTFA를 달성하면서 재생 대비 처리량을 320×로 유지하는 등 RTFX(실시간 배수) 수치가 매우 높다. 서버 측에서 모델과 서빙 스택을 직접 운영하면 관리형 서비스 왕복 시간이 없어 실제 사용자 체감 지연을 더 정확히 제어할 수 있다.
근거
  • 온프레미스 NVIDIA NIM 서빙 환경에서 B200 GPU는 1스트림 TTFA 32ms와 64스트림 동시 처리 시 239ms TTFA·320× RTFX 수치를 보였다. 본문에 실린 NVIDIA TTS NIM Performance 문서(v26.07) 표의 GPU별 TTFA 및 RTFX 수치(온프레미스, 평균 3회 시행)
속도와 품질을 동시에 확보하기 위해 Magpie는 프레임 스태킹과 로컬 트랜스포머라는 두 가지 아키텍처 개선을 결합했다. 프레임 스태킹은 디코더가 한 번의 스텝에서 두 프레임을 예측해 디코더 반복 횟수를 절반으로 줄임으로써 추론 시간을 단축하고, 로컬 트랜스포머는 동시에 생성된 코드북 토큰 간의 의존성을 모델링해 프레임 스태킹으로 인한 품질 저하를 보정한다. 이 구조적 설계는 ICASSP 2026 논문(프레임-스택 로컬 트랜스포머)에 기술된 방법론을 따르며 실제 벤치마크에서 낮은 TTFA와 함께 청취 가능한 품질을 유지한다.
수술 로봇과 조종 콘솔 사이의 비디오 피드와 동작 루프를 그린 다이어그램.
Diagram그림은 원격 조작자(콘솔)에서 비디오 피드를 통해 로봇이 행동을 수행하고 다시 피드백이 돌아오는 실시간 루프를 시각화한다. 좌측의 콘솔과 우측의 수술 로봇이 화살표로 연결되어 있고 'Video Feed'·'Actions' 레이블이 있어 Magpie 같은 저지연 TTS와 실시간 ASR·추론이 로봇 제어·원격 작업에서 어떻게 자리잡는지를 직관적으로 보여준다. 이 도식은 본문에서 강조한 온프레미스 서빙과 낮은 TTFA가 실시간 제어 시나리오에서 중요한 이유를 보조하는 근거로 활용할 수 있다.
근거
  • 추론 속도 향상을 위해 Magpie는 프레임 스태킹과 로컬 트랜스포머를 결합한 아키텍처를 사용한다. 본문의 'Optimized for Real-Time Speech Generation' 설명과 ICASSP 2026 논문 제목 언급
모델 품질 지표에서 이번 릴리스는 여러 언어의 CER(문자 오류율)와 SSIM(화자 유사도)을 개선해 프랑스어와 스페인어에서 뚜렷한 향상을 보였다. 예를 들어 프랑스어 CER는 2.70%에서 1.54%로, 스페인어 CER는 1.14%에서 0.60%로 낮아졌고 SSIM도 각각 0.703→0.747, 0.715→0.793으로 상승했다. 아랍어(1.62% CER), 한국어(2.69% CER), 브라질 포르투갈어(2.91% CER)는 이번 릴리스로 기준선(baseline)이 설정되어 향후 파인튜닝으로 추가 개선이 가능하다.
근거
  • 프랑스어와 스페인어에서 CER가 각각 2.70%→1.54%와 1.14%→0.60%로 개선되고 SSIM도 상승했다. 본문의 'Faster Doesn't Matter If It Doesn't Sound Natural' 섹션에 제시된 언어별 CER·SSIM 표
오픈 가중치 공개는 엔터프라이즈가 배포 제어, 성능 튜닝, 발음·화자 맞춤을 직접 실행할 수 있게 해 배포·보안·커스터마이제이션 측면에서 장점을 제공한다. Magpie는 NeMo를 통한 파인튜닝 경로와 NIM 기반의 GPU 최적화 서빙 스택이라는 두 축을 통해 연구용 오픈 체크포인트와 프로덕션용 컨테이너를 분리해 제공한다. 또한 Nemotron Voice Agent 예제는 Nemotron Speech(ASR), Magpie TTS, Nemotron 언어·멀티모달 모델, NIM 등을 연결해 실시간 바지-인(barge-in)·멀티에이전트 오케스트레이션·다국어 상호작용을 수초 수준 지연으로 구현하는 참고 아키텍처를 제공한다.
지구와 여러 에이전트 아이콘을 사용해 분산 배포와 글로벌 상호작용을 표현한 일러스트.
Infographic검은 배경에 지구를 중심으로 로봇·에이전트 아이콘이 배치된 그림은 다국어·다지역 서비스에서 모델을 분산 배포하고 로컬 데이터 보호를 유지하는 아키텍처를 암시한다. 본문에서 제시한 '온프레미스 배포', '데이터 레지던시', '엔터프라이즈 제어'와 연결되는 시각적 은유로, 오픈 가중치를 통해 지역별 요구에 맞춰 모델을 운영할 수 있음을 전달한다. 다만 그림 자체는 구체적 성능 수치가 아닌 개념적 메시지여서 세부 벤치마크 근거로 직접 사용하기보다는 문맥 보강에 적합하다.

용어 해설

최초 오디오 지연(Time to First Audio (TTFA))
TTFA는 음성 합성 요청이 시작된 시점부터 사용자에게 첫 오디오 프레임이 도달할 때까지의 지연을 뜻한다. 클라이언트-서버 왕복 시간이 없는 온프레미스 배포에서는 서버 사이드 최적화로 직접 단축할 수 있다. 대화형 에이전트에서 전체 응답 지연을 판단하는 핵심 지표로 사용된다.
실시간 처리 배수(RTFX)(RTFX (real-time factor ×))
RTFX는 모델이 재생 시간 대비 몇 배로 오디오를 생성하는지를 나타내는 지표로, 예컨대 300×는 재생 1초당 300초 분량의 오디오를 생성할 수 있음을 의미한다. 동시 스트림 부하 하에서 처리량을 비교할 때 유용하다. 높은 RTFX는 동시 사용자를 효율적으로 처리하는 능력을 보여준다.
프레임 스태킹(Frame stacking)
프레임 스태킹은 디코더가 한 번의 반복에서 두 개 이상의 오디오 프레임을 예측하도록 해 디코더 반복 횟수를 줄이는 기법이다. 반복 수를 절반으로 낮춰 추론 시간을 단축하지만 토큰 간 의존성으로 품질이 저하될 수 있다. 이를 보완하기 위해 후속 처리 모델(예: local transformer)과 결합한다.
로컬 트랜스포머(Local transformer)
로컬 트랜스포머는 동시에 생성된 코드북 토큰 사이의 의존성을 모델링해 프레임 스태킹으로 손상될 수 있는 음성 품질을 복원하는 역할을 한다. 생성된 오디오 토큰을 정교화하는 형태로 동작해 자연스러운 음색과 발음 유지를 돕는다. Magpie는 이 구조를 결합해 속도와 품질을 동시에 확보했다.
NVIDIA NIM
NVIDIA NIM은 GPU에 최적화된 추론 컨테이너 스택으로, 동일 모델의 오픈 체크포인트와는 별도로 프로덕션 지연·처리량 기준을 달성하도록 튜닝된 서빙 환경을 제공한다. 온프레미스 GPU에서 수치화된 TTFA와 RTFX를 재현하도록 설계되어 있다. 개발자는 NIM을 통해 모델 서빙 성능을 직접 제어할 수 있다.

코드 예제

text
cfg_scale = 2.5  # classifier-free guidance
temperature = 0.6
top_k = 80
apply_attention_prior = True
prior_epsilon = 0.1

모델 추론시 권장 설정 값으로, cfg_scale은 텍스트에 대한 응답 엄격도를 높이는 guidance 강도이고 temperature와 top_k는 샘플링의 다양성과 상한을 제어한다. apply_attention_prior와 prior_epsilon은 모델의 주의 가중치에 대한 사전 규제를 적용해 텍스트 준수성과 음성 품질 균형을 조정한다. 프로덕션 배포 전 자체 워크로드에서 수치 민감도를 벤치마크해 값을 튜닝해야 한다.

기술

  • Magpie TTS Multilingual
  • NVIDIA NIM
  • NeMo
  • Nemotron Speech
  • Nemotron language models
  • Hugging Face demo

활용 사례

  • 글로벌 고객 지원용 실시간 음성 에이전트
  • 헬스케어 보조 시스템의 의료 문서화 음성 출력
  • 엔터프라이즈 동료 비서(enterprise copilots)에서의 즉시 음성 응답
  • 실시간 번역 파이프라인과 혼합 언어 대화 처리
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 11.수집 2026. 08. 11.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.