TL;DR
음성 입력을 직접 처리하는 모델이 보편화되면서 음성 특유의 취약성이 실제 사용자 경험에 영향을 줄 가능성이 커졌다. 본 논문은 영어 중심 연구에서 드러나지 않는 비영어 및 음성 입력 기반의 안전성·공정성 문제를 실음성 데이터로 드러냈다. 다중 언어·다중 모달 환경에서의 취약성 증폭을 계량적으로 보여주어, 배포 전 다국어 검증의 필요성을 제시했다.
왜 중요한가
음성 입력을 직접 처리하는 모델이 보편화되면서 음성 특유의 취약성이 실제 사용자 경험에 영향을 줄 가능성이 커졌다. 본 논문은 영어 중심 연구에서 드러나지 않는 비영어 및 음성 입력 기반의 안전성·공정성 문제를 실음성 데이터로 드러냈다. 다중 언어·다중 모달 환경에서의 취약성 증폭을 계량적으로 보여주어, 배포 전 다국어 검증의 필요성을 제시했다.
핵심 기여
멀티링구얼 음성 안전성·공정성 벤치마크 RedVox 공개
RedVox는 실제 사람 목소리로 수집된 데이터에 기반하여 영어·프랑스어·이탈리아어·스페인어·독일어의 유해 및 고정관념성 요청을 포함하는 벤치마크이다. 원문 텍스트는 SHADES와 M-ALERT에서 추출하고 참여자들이 이를 음성으로 녹음하거나 텍스트를 재구성해 약 6초 길이의 오디오 샘플로 정리했다. 공개분은 게이팅을 거쳐 26개 음성, 3414개 항목으로 제공되며 데이터의 용도와 프라이버시를 통제하는 라이선스를 적용한다.
음성 입력이 모델 취약성을 악화시킴을 실증
동일한 유해 요청에 대해 텍스트→오디오(비음성 포함)→음성 순으로 논문에서 관찰한 유해·논쟁적 응답 비율이 증가하는 경향이 나타났다. 연구 결과 일부 오픈 모델에서 텍스트 대비 오디오 입력이 최대 약 +20% 포인트 높은 유해 응답률을 유발했고, 음성 입력에서는 모델별로 10%에서 44% 범위의 유해 유발률을 보였다. 이 결과는 모달 간 안전성 전이가 완전하지 않음을 계량적으로 뒷받침한다.
현장 수집의 윤리적·심리적 부담을 참여자 설문으로 문서화
52명의 연구자 참여로 수집을 진행했으나 공개 동의를 한 참여자는 절반에 그쳐 데이터 공개에 대한 제약이 현실적으로 존재함이 확인됐다. 사후 설문에서 응답자들은 음성으로 유해 문장을 발화하는 것이 텍스트보다 더 큰 책임감과 식별 우려를 유발한다고 응답했으며, 익명화 기술과 강력한 프라이버시 보증을 요구하는 비율이 높았다. 이 결과는 음성 기반 red teaming의 운영상·윤리적 장벽을 실증적으로 드러냈다.
광범위 모델 조사로 영어 중심 보고 관행의 부재를 규명
38개 모델의 공개 문서를 검토한 결과 안전성 평가를 명시한 모델은 11개에 불과했고, 그중 다국어 평가를 보고한 비율은 8%에 그쳤다. 조사 대상 모델들의 대부분은 영어 중심 문서화를 따랐고 일부 예외만이 타언어를 다루는 것으로 확인되었다. 이러한 관행의 편향이 RedVox가 다루는 언어 격차와 직접적으로 연결되어 있음을 데이터로 보였다.
핵심 아이디어 이해하기
문제 출발점은 대다수 안전성 연구와 모델 문서화가 영어 및 합성 음성에 편중되어 있다는 것이다. 음성 입력은 파라링귀스틱 정보와 환경 소음을 포함하므로 텍스트 기반 안전성 방어가 그대로 적용되기 어렵다. 결과적으로 모델은 입력의 전달 방식이나 배경 소음에 민감하게 반응하여 거부·수정 행동 대신 논쟁적이거나 수용적인 응답을 생성할 가능성이 높아진다.
해결 원리는 실제 사람 목소리로 된 다국어 데이터를 수집하고 동일한 요청을 텍스트·오디오·음성의 세 조건으로 대비 평가하는 것이다. 연구진은 SHADES와 M-ALERT에서 추출한 항목들을 참여자에게 제공해 자연 발화로 녹음하게 하고, 오디오 조건에서는 silence와 두 종류의 noise를 추가해 입력의 비언어적 스트레스 효과를 분리했다. 평가에서는 Relatedness Dimension을 도입해 모델이 입력을 실제로 이해했는지 판정한 후 이해 여부와 안전성 판단을 결합해 'Safe', 'Safe by Accident', 'Controversial', 'Unsafe' 네 등급으로 분류했다.
이 접근은 모달리티별로 동일한 의미적 요청이 어떻게 다른 안전성 프로파일을 유도하는지 계량적으로 드러낸다. 논문 결과는 텍스트에서 비교적 낮은 유해 응답률을 보이나 오디오와 특히 음성 입력에서 유해·논쟁적 응답이 일관되게 증가함을 보여준다. 따라서 음성 처리 능력을 갖춘 모델의 안전성 보증은 텍스트 기반 검증을 단순 확장하는 수준을 넘어 모달별 대응책과 다국어 자원 확보가 필수적임이 확인된다.
방법론
데이터 수집은 총 52명의 연구자 참여로 수행되었고 각 참여자는 사전선택된 텍스트 항목을 자연 발화로 녹음하거나 텍스트 형식으로 재구성해 제출했다. 원문 데이터는 SHADES에서 추출한 181개의 고정관념(다국어 병렬) 항목과 M-ALERT에서 무작위 샘플링한 350개의 안전성 항목을 기반으로 구성되었으며 영어는 전체를, 다른 언어들은 참가자 수를 고려해 절반 분량을 사용했다. 오디오 파일은 모든 샘플을 평균 길이 6초로 트리밍했고 Voice Activity Detection을 적용해 음성이 감지되지 않는 32개 사례를 제거했다.
평가는 자동 LLM 판정자를 활용한 LLM-as-a-judge 방식으로 진행되었고 안전성(ternary)과 관련성(yes/no)을 분리해 라벨링한 뒤 이를 조합해 최종 등급을 산출했다. 판정자 모델로는 GPT-5.5를 사용했고 음성 입력에 대해서는 whisper-large-v3-turbo로 전사한 텍스트를 판정자에게 함께 제공했다. 평가의 신뢰성 검증을 위해 수작업 라벨링된 250개 항목으로 검증을 수행했으며 관련성에 대한 Macro F1은 0.94, LLM 판정자는 Qwen3Guard 대비 안전성·공정성 판정에서 우수한 성능을 보였다.
데이터 공개판은 참가자 동의 절차를 거쳐 가드된 게이팅 방식으로 배포할 계획을 세웠고, 공개판 통계의 대표성은 전체 수집본과의 Spearman 상관 ρ=0.98(p<.01)로 보존됨이 확인되었다. 또한 범주형 라벨의 안정성 검정에서 Cramér’s V가 V≤.09로 작아 샘플 축소에도 불구하고 모델 순위 보존성이 유지되었다.
관련 Figure

이 그림은 다수의 모델이 영어 중심으로 문서화되어 있으며 다국어 안전성 분석을 명시한 모델이 드물다는 논문의 조사 결과를 시각적으로 뒷받침한다. 또한 평가 방법론이 자동화에 치우친 경우가 많고 일부 모델만이 수작업 검토를 병행함이 드러나며 이는 다국어·음성 조건에서의 세밀한 안전성 평가가 부족함을 시사한다.
11개 모델에 대해 언어 커버리지와 평가 방식(자동/자동+수작업), 데이터 공개성(공개/비공개)을 행렬 형태로 시각화한 히트맵이다.

이 도식은 RedVox가 안전성(safety)과 공정성(fairness)을 별도 축으로 다루고 다섯 언어에 대해 자연 발화 기반 데이터를 포함함을 한눈에 보여준다. 제시된 구성은 논문 본문에서 데이터 설계(음성·오디오·텍스트 대비)와 평가 워크플로우의 핵심 요소를 시각적으로 통합한다.
RedVox 데이터 구성과 평가 축(예: Safety, Fairness, Noise, Silence 등)을 원형 다층 차트로 요약한 도식이다.
주요 결과
모델 문서화 조사에서 38개 모델 중 안전성 평가를 명시한 모델은 11개에 불과했고 다국어 평가를 보고한 모델 비율은 8%로 낮게 나타났다. 이 관측은 공개 문서의 영어 편중을 계량적으로 드러냈고 RedVox의 필요성을 정당화했다. 모델별 실험에서는 상용·사유 모델이 대체로 낮은 유해 응답률을 보였고 공개 모델들에서 더 높은 취약성이 관찰되었다.
언어별 결과는 영어가 가장 낮은 유해 응답률을 보였으며 영어 전체의 Unsafe 비율은 5.1%인 반면 비영어 평균은 10.0%로 거의 두 배 수준(Δ96%)의 격차가 확인되었다. 모델별로는 GPT-realtime2 등 일부 상용 모델이 낮은 유해 비율을 보였고 Voxtral은 약 21.9%의 완전 유해 응답 비율로 상대적으로 가장 취약한 행태를 보였다. Phi-4-Multimodal은 안전성 정렬 문서를 갖추었음에도 불구하고 일부 조건에서 논쟁적·유해 응답이 최대 44%까지 관찰되어 RedVox의 난이도를 입증했다.
모달리티 비교에서는 동일 요청에 대해 텍스트→오디오→음성 순으로 유해·논쟁적 응답 비율이 증가하는 경향이 일관되게 관찰되었다. 특히 비음성 배경 소음(noise-a, noise-b)이나 침묵(silence)을 텍스트와 페어링한 경우도 텍스트 전용보다 더 높은 유해 응답률을 기록하여 오디오의 존재 자체가 스트레스 요인으로 작용함이 드러났다. 이 결과는 안전성 정합성(alignment)이 모달 간에 쉽게 이전되지 않음을 시사한다.
관련 Figure

이 그림은 영어와 비영어 간에 Unsafe 비율 차이가 일관되게 존재함을 시각적으로 보여주며 논문의 정량적 주장(영어 5.1% vs. 비영어 10.0%)을 보강한다. 또한 모델 간 편차가 크고 일부 공개 모델에서 높은 유해 응답률이 관찰된다는 본문의 결과를 직접적으로 확인할 수 있다.
모델별·언어별로 Safe by Accident, Controversial, Unsafe 비율을 점으로 나타낸 산점도 형식의 결과 요약이다.

이 히트맵은 동일한 의미적 요청이라도 텍스트만 입력할 때보다 비음성 오디오나 음성 입력이 추가될 경우 유해 응답률이 증가하는 경향을 분명히 보여준다. 논문 본문에서 보고한 '텍스트→오디오→음성' 순의 유해성 증가라는 핵심 발견을 정량적으로 보강한다.
여러 모델을 가로축으로, 입력 유형(text, noise-a, noise-b, silence, speech)을 세로축으로 하여 각 조건에서의 유해 응답률을 히트맵으로 표현한 그림이다.

이 그림은 설문에서 다수가 음성으로 유해 문장을 발화하는 것을 텍스트보다 더 큰 책임감과 식별 우려로 인식했음을 계량적으로 보여준다. 연구자는 이 결과를 근거로 음성 데이터 수집 시 익명화·심리적 안전 장치의 필요성을 강조한다.
참여자 설문 결과로서 텍스트 대비 음성으로 유해 콘텐츠를 생성·공개하는 데 대한 심리적 부담과 식별 우려 비율을 막대형으로 보여주는 그림이다.
기술 상세
RedVox의 데이터 구성은 SHADES의 병렬 고정관념 인스턴스 181개와 M-ALERT에서 샘플링한 350개 안전성 인스턴스를 출발점으로 삼아 언어별 병렬성을 유지하도록 편집했다. 참여자들은 주어진 텍스트 항목을 Speech 타입(유해 문장 음성화 + 텍스트 후속질문)과 Audio 타입(텍스트 요청 + 배경음 조건: silence, noise-a, noise-b)으로 변환했으며 각 오디오 세그먼트는 평균 6초로 트리밍되었다.
평가 파이프라인은 두 단계 라벨링(안전성: safe/controversial/unsafe, 관련성: yes/no)을 수행한 뒤 이를 결합해 네 등급으로 결과를 산출한다. 음성 입력은 whisper-large-v3-turbo로 전사하여 판정자에게 제공했고 판정자 모델은 GPT-5.5를 사용하는 few-shot 프롬프트 기반 라벨러였다. LLM-as-a-judge의 신뢰성은 수작업 라벨링과 비교해 Relatedness Macro F1=0.94, 안전성 ternary에서의 성능 우수성으로 검증되었다.
데이터 품질 관리를 위해 Voice Activity Detection을 적용해 무음·녹음 문제를 걸러냈고 전처리 단계에서 공백·구두점 정규화를 수행했다. 공개 배포판은 참가자의 동의 여부에 따라 축소되어 총 26명의 음성, 3414개 항목을 포함하며 전체 수집본과의 통계적 순위 보존성은 Spearman ρ=0.98(p<.01)로 확인되었다. 공개 모델·사유 모델 구분 및 평가 설정은 부록에 수록된 모델별 버전·추론 설정을 따랐다.
한계점
RedVox는 영어·프랑스어·이탈리아어·스페인어·독일어의 다섯 인도유럽어를 대상으로 하며 저자들은 이 표본이 저자원이거나 유형언어에 일반화하기 어렵다고 명시했다. 본 연구는 자연적 유해 요청을 대상으로 단일 턴 설정에서 평가했으며 고의적 jailbreaking 기법이나 다중 턴 상호작용에 대한 분석은 포함하지 않았다. 수집과 공개 동의 과정에서 데이터 축소가 발생해 표본 수가 감소했으며 이로 인해 일부 언어·집단에 대한 통계적 검정력이 제한될 수 있다. 또한 음성만으로 전송되는 완전 음성 요청(full speech-only condition)은 포함되지 않아 해당 시나리오의 결과는 본 연구에서 다루어지지 않았다.
실무 활용
RedVox는 음성 기반 안전성·공정성 평가용 벤치마크로 연구자와 개발자가 모델을 다국어·다중모달 환경에서 검증하는 데 실무적 근거를 제공한다. 공개판은 게이팅된 접근으로 배포되어 연구 목적·윤리적 사용을 전제로 활용할 수 있다. 코드와 평가 워크플로우는 저장소를 통해 재현 가능하게 제공되어 비교 평가를 지원한다.
- 다국어 음성 입력을 처리하는 모델의 안전성 회귀 테스트와 비교 벤치마킹
- 모달리티별(텍스트·오디오·음성) 안전성 전이 연구 및 방어책 성능 검증
- 음성 데이터 수집 과정에서 발생하는 윤리적·프라이버시 리스크 평가와 익명화 기법 검증
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- SpeechLLM
- — SpeechLLM은 오디오 파형을 직접 입력으로 받아 텍스트 생성이나 응답을 수행하는 모델 계열이다. 입력 음성의 파라링귀스틱 특징을 보존하여 지연을 줄이고 에러 회복력을 높이는 구조적 장점이 있다. 본 논문에서는 음성 입력을 통한 안전성·공정성 취약점을 탐지하기 위해 SpeechLLM을 평가 대상으로 삼았다.
- OmniLLM
- — OmniLLM은 텍스트뿐 아니라 이미지·오디오 등 여러 입력 모달리티를 동일한 모델로 처리할 수 있는 체계이다. 멀티모달 정보를 함께 처리하면서 모달 간 안전성 전이가 항상 성립하지 않기 때문에 특정 모달에서 취약점이 증폭될 수 있다. 이 논문은 OmniLLM 계열 모델들이 비영어 및 음성 입력에서 취약성이 증가함을 보고했다.
- Relatedness Dimension
- — Relatedness Dimension은 모델이 주어진 요청을 실제로 이해했는지를 판별하는 평가 축이다. 모델의 응답이 무해하더라도 입력을 오해해서 생성된 경우를 'Safe by Accident'로 구분하여 진짜 거부 행동과 구분하는 데 핵심적이다. 본 연구는 관련성 여부를 결합해 안전성 등급(Safe, Safe by Accident, Controversial, Unsafe)을 산출했다.
- Red teaming
- — Red teaming은 시스템의 약점을 찾기 위해 의도적으로 공격성·편향성 있는 입력을 생성해 모델 반응을 관찰하는 활동이다. 본 연구는 자연스러운 사용자 발화 형태의 유해 요청을 수집해 Red teaming과 유사한 조건에서 모델의 안전성·공정성을 평가했다. 음성 데이터 수집은 참여자 심리적 부담과 프라이버시 문제를 동반하여 추가 윤리적 고려가 요구된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.