본문으로 건너뛰기

single-shot-evaluation

단일 실행 평가

각 요청을 독립적으로 한 번 재현해 기준 모델과 후보 모델의 출력을 비교하는 평가 방식입니다. 이전 단계의 모델 출력이 다음 단계 입력을 바꾸는 다중 대화나 agentic tool loop에는 그대로 적용하기 어렵습니다.