본문으로 건너뛰기

Together AI, Rime의 기업용 TTS 모델 Arcana v2 및 Mist v2 출시

Together AI는 Rime의 고성능 TTS 모델인 Arcana v2와 Mist v2를 도입하여 LLM 및 STT와 통합된 저지연성 음성 AI 파이프라인을 제공한다.

섹션별 상세

01
Rime의 Arcana v2와 Mist v2 모델이 Together AI 모델 라이브러리에 추가되어 LLM 및 STT 워크로드와 동일한 API 및 관측성 환경에서 사용 가능하다. 기존에는 여러 벤더를 조합해야 했던 음성 스택을 단일 플랫폼으로 통합하여 네트워크 오버헤드를 줄이고 관리 효율성을 높였다.
02
Arcana v2는 오디오북이나 팟캐스트가 아닌 실제 고객 서비스 대화 데이터를 학습하여 자연스러운 대화 흐름을 구현했다. 모델은 대화 중의 숨소리, 추임새(fillers), 백채널 신호 등을 학습하여 실제 사람과 대화하는 듯한 경험을 제공하며 40개 이상의 음성과 지역별 방언을 지원한다.
03
Mist v2는 대규모 프로덕션 환경을 위한 결정론적 발음 제어 기능을 제공한다. 사용자가 API를 통해 특정 단어의 발음을 한 번 정의하면 모든 음성과 채널에서 동일하게 렌더링되므로 브랜드명이나 의학 용어 등의 오발음을 방지할 수 있다.
04
Together AI 전용 엔드포인트에서 Mist v2는 약 225ms의 첫 오디오 생성 시간(TTFA)을 달성했다. 음성 에이전트가 자연스럽게 느껴지기 위한 전체 지연 시간 기준인 700ms를 충족하기 위해 TTS 단계의 지연 시간을 최소화하여 STT와 LLM 처리를 위한 충분한 시간적 여유를 확보했다.
05
Together AI의 인프라는 SOC 2 Type II, HIPAA, PCI 규정을 준수하여 금융 및 의료 분야의 엄격한 요구사항을 충족한다. 단일 플랫폼에서 전체 음성 스택을 운영함으로써 보안 검토 과정을 간소화하고 데이터 소유권 및 제어권을 유지할 수 있다.

용어 해설

텍스트 음성 변환(TTS)
텍스트를 인공적인 음성으로 변환하는 기술이다. 딥러닝 모델을 통해 인간의 목소리 톤, 억양, 감정을 모사하여 자연스러운 오디오를 생성하며 음성 에이전트의 핵심 구성 요소이다.
음성 텍스트 변환(STT)
사람의 음성 신호를 텍스트 데이터로 변환하는 기술이다. 실시간 대화형 AI 시스템에서 사용자의 입력을 모델이 이해할 수 있는 형식으로 바꾸는 첫 번째 단계 역할을 한다.
결정론적 발음 제어(Deterministic Pronunciation)
모델이 매번 발음을 추측하는 대신 사용자가 정의한 규칙에 따라 항상 동일하게 발음하도록 보장하는 기능이다. 브랜드명이나 전문 용어의 발음 오류를 방지하는 데 필수적이다.
지연 시간(Latency)
데이터 처리가 시작되어 결과가 나올 때까지 걸리는 시간이다. 실시간 음성 대화에서는 사용자 경험을 위해 전체 파이프라인 지연 시간을 700ms 이내로 유지하는 것이 중요하다.
전용 엔드포인트(Dedicated Endpoint)
특정 사용자나 작업을 위해 격리된 GPU 자원을 할당하는 방식이다. 공용 API와 달리 성능 변동이 적고 보안성이 높으며 대규모 프로덕션 환경에서 안정적인 추론 속도를 보장한다.

기술

  • Together AI
  • Rime Arcana v2
  • Rime Mist v2
  • GPU Dedicated Endpoints
  • WebSocket

활용 사례

  • 글로벌 컨택 센터
  • 실시간 고객 서비스 챗봇
  • 의료용 음성 에이전트
  • 금융권 보이스 뱅킹

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2025. 12. 18.수집 2026. 02. 21.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.