LLM-as-a-Jury
LLM-as-a-Jury는 대화를 자동 채점하기 위해 LLM을 심사자 역할로 사용하는 평가 방식이다. 입력으로 대화 로그와 채점 기준을 제공하고 모델은 내부적으로 기준을 해석해 점수와 근거를 출력하는 처리 과정을 수행한다. PatientAgentBench에서는 이 방식을 6개 차원과 100개 이상의 임상 근거 기준에 적용해 자동화된 채점을 수행했다는 점이 핵심이다.