TL;DR
텍스트 번역 전문 기업 DeepL이 실시간 음성 대 음성 번역 솔루션을 출시하며 사업 영역을 확장했다. 이 제품군은 Zoom 및 Microsoft Teams용 애드온, 모바일 및 웹 대화 도구, 그리고 개발자를 위한 API를 포함한다. 현재 시스템은 음성을 텍스트로 변환한 뒤 번역하고 다시 음성으로 합성하는 단계를 거치며, DeepL은 기존의 높은 텍스트 번역 품질을 경쟁력으로 내세우고 있다. 향후 텍스트 단계를 생략하고 지연 시간을 최소화하는 엔드투엔드 모델 개발을 목표로 하고 있다.
배경
실시간 번역 시스템의 지연 시간(Latency) 개념, STT(Speech-to-Text) 및 TTS(Text-to-Speech)의 기본 원리
대상 독자
글로벌 협업이 필요한 기업 관리자 및 다국어 서비스 구축을 고려하는 개발자
의미 / 영향
DeepL의 음성 시장 진출은 기존 텍스트 번역의 높은 신뢰도를 바탕으로 실시간 통역 시장의 판도를 바꿀 가능성이 큽니다. 특히 API 제공을 통해 다양한 산업군에서 맞춤형 음성 번역 솔루션 도입이 가속화될 것으로 보입니다.
섹션별 상세
- DeepL의 음성 번역 기술은 산업별 전문 용어와 고유 명칭을 학습하고 적응할 수 있다. — 본문 중반 'DeepL said that its voice-to-voice tech can also learn and adapt to custom vocabulary' 문장
- DeepL은 현재 음성을 텍스트로 변환하고 번역한 뒤 다시 음성으로 변환하는 방식을 사용한다. — 본문 하단 'The company said that it controls the entire voice-to-voice stack' 문단
용어 해설
- Voice-to-Voice Translation
- — 말하는 사람의 음성을 실시간으로 인식하여 다른 언어의 음성으로 즉시 변환해 출력하는 기술이다. 음성 인식(STT), 기계 번역, 음성 합성(TTS) 과정을 거치며, 최근에는 이 단계를 통합한 엔드투엔드 모델 연구가 활발하다.
- Latency
- — 데이터가 입력되어 결과가 출력되기까지 걸리는 물리적 시간을 의미한다. 실시간 음성 번역에서는 화자가 말을 마친 후 번역된 음성이 들리기까지의 간격을 뜻하며, 사용자 경험을 결정짓는 핵심 지표이다.
- Speech Synthesis
- — 텍스트 데이터를 인공적인 인간의 목소리로 변환하는 기술로 TTS(Text-to-Speech)라고도 불린다. 번역된 텍스트를 자연스러운 억양과 음색으로 전달하여 실제 대화와 유사한 경험을 제공하는 역할을 한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.