본문으로 건너뛰기

실제 통화에서 무너지는 ASR 평가의 함정

WER 하나로는 실제 통화 전사의 품질과 위험을 판단할 수 없습니다.,

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

ASR의 WER는 평가 말뭉치와 정규화 규칙에 따라 크게 달라지며, 깨끗한 벤치마크에서 약 5%인 시스템도 실제 상담 통화에서는 16.5–19.2%를 기록할 수 있습니다. WER는 삽입·삭제·치환을 동일하게 세기 때문에 핵심 엔터티 오류, 화자 귀속 오류, 실제 음성에 없는 환각 문장을 충분히 반영하지 못합니다. 두 숙련 전사자도 대화형 전화 음성에서 4.1–4.5% 불일치하므로 기준 전사 역시 오차 범위를 가집니다. 구매자는 모델 카드의 단일 수치보다 자체 통화 데이터와 원본 오디오를 활용한 이중 검수, 엔터티 지표, 화자 지표를 중심으로 ASR을 평가해야 합니다.

섹션별 상세

01
상용 ASR 시스템은 깨끗한 벤치마크보다 실제 상담 통화에서 훨씬 높은 오류율을 기록하며, 2020년 연구에서 통화 음성의 WER는 16.5–19.2%, Switchboard에서는 10.2–11.6%였습니다. 벤치마크는 낭독 음성·근접 마이크·짧은 사전 분할 구간을 쓰지만 실제 통화에는 협대역 코덱, 잡음, 겹침 발화, 침묵과 IVR이 함께 들어갑니다. 따라서 모델 성능을 구매 판단에 연결하려면 공개 수치보다 자체 통화 데이터에서 동일한 조건으로 측정해야 합니다.
02
현대 ASR은 과거의 HMM·음향 모델·발음 사전·언어 모델을 분리하던 구조에서 하나의 End-to-End 네트워크로 이동했습니다. CTC는 프레임 동기화와 조건부 독립 출력으로 빠르게 작동하고, RNN-T와 TDT는 이미 출력한 토큰을 활용해 실시간 입력을 처리하며, Whisper 계열 Encoder-Decoder는 전체 발화를 순차적으로 복호화해 정확도와 다국어 범위를 확보합니다. Conformer Encoder와 LLM Decoder를 결합한 구조는 영어 정확도 상위권을 차지했지만, 유용한 배치 추론에는 데이터센터 GPU가 필요해 지연·정확도·하드웨어 비용의 절충이 남습니다.
03
ASR 출력은 단어만으로 이루어지지 않고 토큰, 타임스탬프, 문장부호와 대소문자, 화자 정보가 서로 다른 처리 단계에서 생성됩니다. Whisper는 텍스트와 타임스탬프는 반환하지만 화자를 알지 못하므로, 대화형 전사에는 별도의 Speaker Diarization 모델을 결합해야 하고 화자 오류는 일반 WER에 포함되지 않습니다. Open ASR Leaderboard가 문장부호·대소문자·숫자·필러를 정규화한 뒤 점수화하는 까닭도 같은 WER라도 실제 출력의 가독성과 활용성이 다르기 때문입니다.
04
WER는 치환·삽입·삭제를 기준 전사 단어 수로 나눈 값일 뿐 정답 단어 비율이 아니며, 삽입이 많으면 100%를 넘습니다. 같은 Switchboard 음성과 시스템을 고정한 채 정규화 관례만 바꾸자 한 시스템의 수치가 10.18%에서 6.43%로, 다른 시스템은 11.10%에서 6.42%로 이동했습니다. 그러므로 WER는 반드시 평가 말뭉치와 정규화 도구를 함께 표기해야 하며, 이름·약품·계좌번호 같은 핵심 엔터티 오류는 별도 지표로 확인해야 합니다.
05
사람의 기준 전사도 완전한 정답이 아니며, LDC의 두 숙련 전사자는 대화형 전화 음성에서 4.1–4.5%의 불일치를 보였습니다. 두 전사자가 다르게 판단한 차이의 95%는 오류라기보다 판단 차이로 판정됐고, 전사 방식에 따라 인간 기준 WER 자체도 동일한 CallHome 음성에서 1.66배 달라졌습니다. 한 사람의 교정 결과를 절대 기준으로 취급하기보다 이중 검수·골드 아이템·수정자 기록으로 검수자 간 합의를 측정해야 합니다.
06
긴 음성, 비음성 구간, 방언, 장애 음성, 저자원 언어에서는 일반적인 WER가 전사의 위험을 충분히 포착하지 못합니다. Whisper 평가에서는 약 1%의 전사에 실제 음성에 없는 문장이나 구절이 포함됐고, 그중 38%는 폭력이나 허위 권위 같은 명시적 위해를 담았으며, 실어증 화자 구간의 환각률은 1.8%로 대조군의 1.1%보다 높았습니다. 환각 문장과 단순 단어 치환을 같은 오류 하나로 세는 WER의 구조 때문에 원본 음성을 보존한 상태에서 전사 결과를 청취 검수해야 합니다.
07
ASR 오류는 후속 분류·요약·규제 업무로 전달되며, 영향은 작업 종류에 따라 달라집니다. CHI 2025 연구에서 ASR 출력으로 실행한 분류기의 F1은 Black 튜터에서 0.66에서 0.51로, white 튜터에서 0.64에서 0.54로 낮아졌고, 전사 단계의 차이가 하위 시스템에서 커졌습니다. 요약은 여러 발화를 합쳐 상대적으로 오류에 강하지만, 컴플라이언스 증거·분쟁 재구성·Voice Agent 평가는 특정 단어와 화자에 의존하므로 단어와 화자 귀속을 함께 검수해야 합니다.
08
모델 선택보다 실제 데이터에 맞춘 평가와 교정 설계가 최종 품질을 좌우합니다. 약 30% WER 아래에서는 ASR 결과를 바탕으로 수정하는 편이 처음부터 입력하는 것보다 유리했지만, 이 기준은 강의와 자막 작업에서 얻은 결과라 전화 상담에 그대로 적용할 수 없습니다. 자체 녹음에서 모델을 비교하고 원본 파형 위에서 단어와 화자 귀속을 함께 수정하며, 녹음 보존·이중 검수·합의 점수·수정 이력까지 운영해야 측정값이 규제와 현업 의사결정에 견딜 수 있습니다.

용어 해설

단어 오류율(Word Error Rate (WER))
음성 인식 결과의 치환·삽입·삭제 단어 수를 기준 전사 단어 수로 나눈 지표입니다. 삽입 오류 때문에 100%를 넘을 수 있으며, 정규화 규칙과 평가 말뭉치에 따라 같은 시스템의 수치가 크게 달라집니다. 따라서 WER만으로 실제 전사의 유용성이나 오류 비용을 판단하기 어렵습니다.
화자 분리(Speaker Diarization)
음성 기록에서 누가 언제 말했는지를 구분해 전사문에 화자 정보를 붙이는 처리입니다. ASR이 단어와 타임스탬프를 생성한 뒤 별도 모델이 발화 구간과 화자를 추정하므로, 단어 오류와 다른 오류가 생깁니다. 상담 기록이나 규제 증거처럼 발화자 식별이 필요한 작업에서는 WER만으로 품질을 판단할 수 없습니다.
Conformer
음성의 시간적 관계와 국소적인 음향 패턴을 함께 처리하도록 설계된 음성 인식용 Encoder 구조입니다. 2026년 Open ASR Leaderboard에서는 60개 공개 모델 가운데 24개가 Conformer Encoder를 사용했고, LLM Decoder와 결합한 모델이 영어 정확도 상위권을 차지했습니다. 높은 정확도와 처리 비용 사이의 선택에 직접 영향을 줍니다.
Connectionist Temporal Classification(Connectionist Temporal Classification (CTC))
음성 프레임과 문자 또는 토큰을 시간 순서대로 연결하는 학습 방식입니다. 각 출력이 조건부 독립이라는 구조 덕분에 실시간 처리와 엣지 배포에 유리하지만 Decoder 내부의 언어 모델링이 약해 정확도 손실이 생길 수 있습니다. 기사에서는 CTC 모델의 최고 순위가 영어 WER 기준 23위였다고 설명합니다.
문맥 기반 편향(Contextual Biasing)
제품명·약품명·계좌번호처럼 특정 도메인에서 중요한 단어 목록을 ASR Decoder에 제공해 인식 확률을 조정하는 기법입니다. 일반 단어의 출력을 크게 바꾸지 않으면서 목록에 있는 희귀 단어의 오류를 줄이는 방식이며, 기사에 인용된 연구에서는 편향 단어 WER가 최대 88% 상대 감소했습니다. 평균 WER이 가리는 엔터티 오류를 별도로 줄이는 데 쓰입니다.

기술

  • ASR
  • Whisper
  • Conformer
  • CTC
  • RNN-T
  • TDT
  • LLM decoder
  • Open ASR Leaderboard
  • Speaker Diarization
  • VAD
  • Contextual Biasing
  • NVIDIA Canary-Qwen 2.5B
  • IBM Granite Speech 3.3
  • Phi-4-multimodal-instruct
  • NVIDIA Parakeet TDT 0.6B v2
  • Kyutai STT 2.6B en
  • Voxtral Mini 3B / Small 24B
  • Qwen3-Omni-30B-A3B

활용 사례

  • 컨택센터 통화 전사와 품질 평가
  • 실시간 자막과 Voice Assistant
  • 컴플라이언스 증거 및 분쟁 기록
  • 고객 불만·의도 분류
  • Voice Agent 학습과 평가
  • 의료 음성 기록
  • 방언·장애 음성 접근성 지원
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 13.수집 2026. 08. 13.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.