human-preference-ranking
인간 선호도 기반 랭킹
인간 평가자를 사용해 모델 출력을 순위화하는 방식으로, 입력에 대한 출력의 선호도를 수집해 모델 간 비교를 가능하게 한다. 입력에 여러 모델 응답을 주고 사람이 더 나은 응답을 고르면 그 데이터가 순위 기준이 되어 모델 성능을 비교하는 지표가 된다. 사용자 경험(fluency, 형식적 선호)와 직접 연결되므로 객관적 벤치마크와는 다른 편향을 만들어낼 수 있어 모델 행동 변화를 유발할 가능성이 있다.