본문으로 건너뛰기

계층별 음성 기반 다국어 우울증 탐지와 지도형 대조 정렬(CLeaD) 분석

화자 독립 검증과 supervised contrastive alignment를 결합한 CLeaD는 MODMA에서 LOSO 기준 스피커 F1을 0.640으로 끌어올리며 영어-만다린 간 임상 신호 정렬을 일부 개선했다.

용어 해설

지도형 대조 손실(Supervised Contrastive Loss)
클래스 레이블을 이용해 같은 클래스 샘플들을 임베딩 공간에서 가깝게 당기고 다른 클래스는 멀어지게 하는 손실로, 온도 τ와 정규화된 내적을 이용해 배치 내 양성 쌍을 강화하여 도메인 간 정렬을 유도한다.
WavLM
대규모 음성 자가지도 학습 모델로서 중간 계층에서 발화자의 정서·운율 정보를 부분적으로 포착하며 본 연구에서는 동결된 특징 추출기로 사용되어 계층별 표현 전이가 비교되었다.
화자 단위 검증(LOSO)(Leave-One-Speaker-Out)
각 평가 반복에서 하나의 화자를 홀드아웃하여 검증하는 절차로, 동일 화자의 세그먼트가 학습과 테스트에 중복되는 speaker-identity leakage를 방지하여 실제 일반화 성능을 더 엄격하게 측정한다.
화자 정체성 유출(Speaker-Identity Leakage)
학습·검증 데이터 분할에서 동일 화자의 세그먼트가 양쪽에 포함되어 모델이 우울증 신호 대신 화자 고유 특징을 학습하여 성능이 과대평가되는 현상으로, 본 논문에서 수량적으로 영향력을 분리하여 보였다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 03.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.