본문으로 건너뛰기
HF Daily Papers조회 2

소믈리에(Sommelier): 전이중 음성 언어 모델을 위한 확장 가능한 오픈소스 다중 턴 오디오 전처리 파이프라인

기존 음성 AI는 한 명씩 번갈아 말하는 데이터에 의존해 실제 대화의 겹침이나 끼어들기를 처리하는 데 한계가 있었다. 이 논문은 복잡한 다인 대화 오디오를 자동으로 정제하고 분리하는 파이프라인을 공개하여, 사람처럼 자연스럽게 듣고 동시에 말하는 '전이중(Full-duplex)' 모델 개발의 데이터 부족 문제를 해결한다.

용어 해설

전이중 통신(Full-duplex)
데이터의 송신과 수신이 동시에 이루어지는 통신 방식이다. 음성 AI 맥락에서는 시스템이 사용자의 말을 들으면서 동시에 답변을 생성하고 출력할 수 있는 능력을 의미하며, 사람 간의 자연스러운 대화와 유사한 상호작용을 가능하게 한다.
화자 분할(Speaker Diarization)
오디오 신호 내에서 화자가 바뀌는 시점을 찾아내어 '누가 언제 말했는지'를 식별하는 기술이다. 다수가 참여하는 대화 데이터에서 각 화자의 발화를 개별적으로 분리하고 구조화하는 데 필수적인 전처리 과정이다.
음성 인식 환각(ASR Hallucination)
음성 인식(ASR) 모델이 실제 오디오에는 없는 단어를 생성하거나, 무음 또는 노이즈 구간에서 무의미한 텍스트를 반복적으로 출력하는 현상이다. 이는 학습 데이터의 품질을 저하시키는 주요 원인이 된다.
ROVER 앙상블(ROVER Ensemble)
여러 음성 인식 모델의 출력 결과를 단어 단위로 정렬하고 다수결 투표를 통해 가장 신뢰도 높은 결과를 선택하는 기법이다. 단일 모델의 오류를 상호 보완하여 전체적인 전사 정확도를 높이는 데 사용된다.

코드 예제

json
{
  "metadata": {
    "audio_duration_seconds": 120.0,
    "vad_sortformer": {
      "processing_time_seconds": 0.97427,
      "rt_factor": 0.00811
    },
    "whisper_large_v3": {
      "processing_time_seconds": 14.90329,
      "rt_factor": 0.12419
    }
  },
  "segments": [
    {
      "start": 0.0,
      "end": 0.64,
      "text": "Mr. Franklin?",
      "speaker": "SPEAKER_00",
      "is_separated": true,
      "words": [
        { "word": "Mr.", "start": 0.0, "end": 0.171, "score": 0.414 },
        { "word": "Franklin?", "start": 0.192, "end": 0.661, "score": 0.936 }
      ]
    }
  ]
}

Sommelier 파이프라인을 거쳐 생성된 최종 데이터의 JSON 구조 예시

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 20.수집 2026. 03. 31.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.