PatientAgentBench 벤치마크
환자 대면 의료 에이전트를 지속적 대화와 도구 사용 환경에서 평가하도록 설계된 프레임워크이며, 에이전트가 시뮬레이션 환자와 도구 샌드박스를 통해 상호작용한 대화를 LLM-as-a-Jury로 채점하는 구조로 구성되어 있다.