TL;DR
의료 분야에서 LLM의 역할이 단순 지식 답변을 넘어 실제 임상 의사결정을 수행하는 에이전트로 확장됨에 따라 이를 평가할 새로운 기준이 필요해졌다. 본 발표에서는 서울대학교 DSBA 연구실에서 개발한 AgentClinic과 MedAgentBench라는 두 가지 혁신적인 벤치마크를 상세히 분석한다. AgentClinic은 멀티모달 데이터를 기반으로 한 도구 활용 능력을, MedAgentBench는 실제 병원의 EHR 환경을 모사한 데이터 조작 및 추론 능력을 중점적으로 평가한다. 실험 결과 최신 모델들도 복잡한 임상 시나리오와 시간적 추론에서 한계를 보였으며 이는 향후 의료 AI 에이전트가 나아가야 할 연구 방향을 제시한다.
챕터별 상세
발표자 및 연구 배경 소개
의료 분야 AI 에이전트의 필요성
기존 의료 QA 벤치마크의 한계점
AgentClinic: 멀티모달 도구 활용 벤치마크 개요
AgentClinic의 데이터셋 구성 및 수집 과정
임상 시나리오 설계를 위한 에이전트 역할 정의
도구 활용(Tool-use) 성능 평가 지표
AgentClinic 실험 결과 및 모델별 성능 비교
MedAgentBench: 가상 EHR 환경의 필요성
가상 EHR 환경 구축 방법론
MedAgentBench의 핵심 태스크 설계
현실적인 의료 데이터 조작 및 추론 과정
MedAgentBench 실험 결과 분석
의료 에이전트의 안전성 및 윤리적 고려사항
향후 연구 방향 및 결론
질의응답 세션
용어 해설
- EHR
- — 환자의 진료 이력, 검사 결과, 처방 내역 등을 디지털로 기록한 시스템이다. 의료 에이전트가 환자의 상태를 파악하고 의사결정을 내리는 데 필요한 핵심 데이터 소스로 활용된다.
- Multimodal
- — 텍스트, 이미지, 수치 데이터 등 서로 다른 형태의 정보를 동시에 처리하고 이해하는 기술이다. 임상 환경에서 엑스레이 이미지와 혈액 검사 결과를 함께 분석하여 진단을 내리는 데 필수적이다.
- Tool-use
- — LLM이 외부 API나 소프트웨어를 호출하여 정보를 검색하거나 계산을 수행하는 능력이다. 의료 에이전트가 진단 도구를 선택하거나 EHR 시스템에 데이터를 입력할 때 핵심적인 역할을 한다.
- FHIR
- — 의료 데이터를 교환하기 위한 국제 표준 프레임워크이다. MedAgentBench와 같은 가상 EHR 환경에서 데이터 구조를 표준화하여 에이전트가 일관된 방식으로 정보를 처리할 수 있게 돕는다.
- Temporal Reasoning
- — 시간의 흐름에 따른 데이터의 변화와 인과 관계를 파악하는 능력이다. 환자의 증상 변화 추이를 분석하여 질병의 진행 단계나 치료 효과를 판단하는 데 매우 중요하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



