본문으로 건너뛰기
HF Daily Papers조회 1

LingxiDiagBench: 중국어 정신과 상담·진단 평가를 위한 다중 에이전트 벤치마크 및 EMR 정렬 합성 대화(LingxiDiag-16K)

정신과 진단은 다중 정보수집과 감별 진단 능력을 요하는데, 기존 벤치마크는 정적·템플릿 기반 데이터로 실제 상담 흐름과 진단 레이블을 동시에 평가하지 못한다. 본 연구는 EMR 분포에 정렬된 대규모 합성 대화와 에이전트 기반 동적 평가 파이프라인을 제공해 LLM의 정보수집 전략과 최종 진단 성능을 동시에 측정할 수 있게 한다.

용어 해설

다중 에이전트(Multi-Agent)
환자, 의사, 진단 역할을 각각 에이전트로 분리하여 상호작용을 시뮬레이션하는 접근법이다. 에이전트 간 대화와 역할 분담을 통해 실제 임상 상담의 절차적 흐름을 재현하고, 정보수집 전략과 진단 결정을 분리하여 평가할 수 있다.
LLM-평가자(판정자)(LLM-as-a-Judge)
여러 LLM을 평가자 역할로 사용해 대화 품질과 일관성을 점수화하는 기법이다. 서로 다른 평가 모델을 앙상블해 인간 평가자에 대한 상관을 측정하고 자동화된 정성 지표를 산출하는 데 사용된다.
EMR 정렬(EMR-aligned)(EMR-aligned)
합성 대화를 실제 전자의무기록(EMR)의 인구통계·진단 분포와 통계적으로 일치시키는 과정이다. 실제 데이터에서 추출한 지식그래프를 바탕으로 샘플링해 합성 EMR과 대화를 생성함으로써 임상적 대표성을 유지한다.
감별 진단(Differential Diagnosis)
여러 정신과적 진단 후보를 비교·배제하여 최종 진단을 도출하는 과정이다. 대화에서 획득한 증상·기능장애·병력 정보를 종합해 여러 ICD-10 범주 중 우선순위를 판단하는 능력이 핵심이다.
MRD-RAG(검색 보조 진단 지침 활용)(MRD-RAG)
진단 후보군 관련 문헌이나 진단 지침을 검색해 의사 결정을 보조하는 RAG 계열 방식이다. 상위 N개의 잠재 진단 지침을 가져와 다음 질문 계획에 반영해 정보수집을 안내한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 11.수집 2026. 06. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.