본문으로 건너뛰기
HF Daily Papers조회 1

VIBE: 사람 음성을 이용한 대형 오디오-언어 모델의 자유응답 생성 편향 정량화

VIBE는 인간 녹음 음성과 자유응답 태스크, LLM 기반 속성 추출기, 정규화된 TVD와 스피커 수준 순열 검정을 결합해 12개 LALM에서 발화자의 성별과 억양이 생성 결과 분포를 의미있게 바꾸는 편향을 검출했다.

용어 해설

총변동거리(Total Variation Distance (TVD))
서로 다른 그룹에서 관찰된 범주형 분포 간 차이를 수치화하는 거리이다. 각 그룹의 값 빈도를 정규화하여 절대차를 합한 뒤 평균을 취하고 0.5를 곱해 계산하며 그룹 간 분포 불균형을 직접 측정하는 지표로 사용된다.
정규화된 nTVD(nTVD)
TVD를 그룹 수에 따라 정규화한 지표로 0에서 100 범위를 갖는다. TVD를 1−1/|G|로 나눈 뒤 100을 곱해 서로 다른 그룹 수에서도 값이 비교 가능하도록 스케일을 맞춘다.
스피커 수준 순열 검정(Speaker-level Permutation Test)
각 스피커가 여러 발화를 제공하는 구조를 고려해 귀무가설 하에서 스피커 단위를 무작위로 재배치하여 통계적 유의성을 판정하는 검정이다. 발화 단위 섞기로 인한 상관성 과대평가를 피하기 위해 스피커를 교환 단위로 사용한다.
LLM 기반 속성 추출기(LLM-based Extractor)
자유서술 텍스트에서 직업·취미·성격 등 구조화된 속성 목록을 생성하는 LLM 프롬프트 파이프라인이다. 모델 출력의 자유도를 유지하면서 정량적 분석에 적합한 레이블로 변환하는 중간 단계 역할을 수행한다.
사람이 녹음한 음성(Human-Recorded Speech)
합성 음성이 아닌 실제 화자가 녹음한 발화로서 발화자의 발음·억양·부가적언어학적 단서를 포함한다. 모델의 현장 배포 환경을 더 잘 반영하기 때문에 음성 유발 편향 평가에서 중요하게 사용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 03.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.