TL;DR
다국어 사용자의 코드 스위칭 환경에서 음성 에이전트의 정확도를 평가하기 위해 4개 언어 쌍을 포함한 벤치마크 데이터셋을 구축했다. ElevenLabs Scribe V2, Gemini 3 Flash, AssemblyAI Universal 3-Pro가 전반적인 음성 인식 정확도와 의미 보존 능력에서 우수한 성능을 보였다. 반면, OpenAI Whisper는 코드 스위칭 오디오를 전사하지 않고 영어로 번역하는 경향을 보여 성능이 낮게 나타났다. 언어 전환 횟수는 오류 발생 빈도와, 코드 혼용 밀도(CMI)는 오류의 심각성과 밀접한 상관관계를 보였다. 이번 벤치마크는 기업이 실제 고객의 언어 환경에 맞는 ASR 모델을 선택하는 데 필요한 구체적인 성능 지표를 제공한다.
배경
ASR 모델의 기본 개념, WER, SWER, AER 등 음성 인식 평가 지표에 대한 이해, 코드 스위칭 현상에 대한 기초 지식
대상 독자
프로덕션 환경에서 다국어 음성 에이전트를 운영하는 개발자 및 엔지니어
의미 / 영향
이 벤치마크는 코드 스위칭이 빈번한 실제 비즈니스 환경에서 범용 ASR 모델의 한계를 명확히 하고, 전용 모델 선택의 중요성을 강조한다. 기업은 단순히 WER 수치에 의존하지 않고 의미 보존력(SWER, AER)을 평가하여 고객 경험을 저해하지 않는 최적의 모델을 선정해야 한다.
섹션별 상세




- ElevenLabs Scribe V2와 Gemini 3 Flash가 모든 언어 쌍에서 최상위권 성능을 기록했다. — Findings 섹션의 WER 및 SWER/AER 결과 분석 부분
- OpenAI Whisper는 코드 스위칭 오디오를 전사하지 않고 영어로 번역하는 경향이 있다. — Findings 섹션의 WER 결과 및 Whisper 관련 설명


- 오류는 언어 전환 지점뿐만 아니라 영어로 된 문장 구간 전반에 걸쳐 집중된다. — Findings 섹션의 'Portions of a code-switched utterance contributing to transcription errors' 부분
용어 해설
- Code-switching
- — 한 문장 내에서 두 개 이상의 언어를 섞어서 사용하는 현상. 다국어 사용자에게 자연스러운 대화 방식이나, ASR 모델에게는 언어 전환으로 인해 전사 오류를 유발하는 난제임.
- ASR
- — 음성 신호를 텍스트로 변환하는 기술. 음성 에이전트 파이프라인의 첫 단계로, 여기서 발생한 오류는 후속 작업의 성능을 저하시킴.
- WER
- — 모델이 생성한 전사 결과와 정답 텍스트를 비교하여 단어 단위의 오차를 계산하는 지표. ASR 모델의 기본적인 정확도를 측정하는 표준 척도임.
- SWER
- — 단순 철자 오차가 아닌, 문장의 의미를 왜곡하는 오류만을 측정하는 지표. 모델이 문맥을 얼마나 정확하게 이해하고 전사하는지 평가함.
- AER
- — 전사된 텍스트를 기반으로 후속 질문에 답변할 때 발생하는 오류를 측정하는 지표. 전사 오류가 실제 업무 수행에 미치는 실질적 영향을 평가함.
기술
- ElevenLabs Scribe V2
- Gemini 3 Flash
- AssemblyAI Universal 3-Pro
- Deepgram Nova 3
- Mistral Voxtral
- Nvidia Parakeet
- OpenAI Whisper
활용 사례
- 고객 센터 음성 에이전트
- IT 헬프데스크 자동화
- 다국어 음성 전사 시스템
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.