용어 해설
- 전이중 통신(Full-duplex)
- — 데이터의 송신과 수신이 동시에 이루어지는 통신 방식이다. 음성 AI 맥락에서는 시스템이 사용자의 말을 들으면서 동시에 답변을 생성하고 출력할 수 있는 능력을 의미하며, 사람 간의 자연스러운 대화와 유사한 상호작용을 가능하게 한다.
- 화자 분할(Speaker Diarization)
- — 오디오 신호 내에서 화자가 바뀌는 시점을 찾아내어 '누가 언제 말했는지'를 식별하는 기술이다. 다수가 참여하는 대화 데이터에서 각 화자의 발화를 개별적으로 분리하고 구조화하는 데 필수적인 전처리 과정이다.
- 음성 인식 환각(ASR Hallucination)
- — 음성 인식(ASR) 모델이 실제 오디오에는 없는 단어를 생성하거나, 무음 또는 노이즈 구간에서 무의미한 텍스트를 반복적으로 출력하는 현상이다. 이는 학습 데이터의 품질을 저하시키는 주요 원인이 된다.
- ROVER 앙상블(ROVER Ensemble)
- — 여러 음성 인식 모델의 출력 결과를 단어 단위로 정렬하고 다수결 투표를 통해 가장 신뢰도 높은 결과를 선택하는 기법이다. 단일 모델의 오류를 상호 보완하여 전체적인 전사 정확도를 높이는 데 사용된다.
코드 예제
{
"metadata": {
"audio_duration_seconds": 120.0,
"vad_sortformer": {
"processing_time_seconds": 0.97427,
"rt_factor": 0.00811
},
"whisper_large_v3": {
"processing_time_seconds": 14.90329,
"rt_factor": 0.12419
}
},
"segments": [
{
"start": 0.0,
"end": 0.64,
"text": "Mr. Franklin?",
"speaker": "SPEAKER_00",
"is_separated": true,
"words": [
{ "word": "Mr.", "start": 0.0, "end": 0.171, "score": 0.414 },
{ "word": "Franklin?", "start": 0.192, "end": 0.661, "score": 0.936 }
]
}
]
}Sommelier 파이프라인을 거쳐 생성된 최종 데이터의 JSON 구조 예시
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.