용어 해설
- 보상 해킹(Reward Hacking)
- — 모델의 평가 점수를 실제 목표의 개선 없이 높이는 현상입니다. 이 연구에서는 논문의 과학적 내용과 보고된 증거를 유지한 채 표현 방식만 바꾸어 AI 심사 점수가 움직이는지 측정하는 의미로 사용됩니다.
- 수사적 프레이밍(Rhetorical Framing)
- — 같은 주장과 증거를 어떤 어조와 구조로 제시할지 정하는 표현 방식입니다. 연구에서는 참신성, 범위, 증거 강조 수준 등을 바꾸고 AI 심사자가 과학적 가치로 오인하는지 비교합니다.
- 약한 수락 확률(Weak-Accept Probability)
- — AI 심사에서 Overall Assessment가 6점 이상인 평가의 비율입니다. 이 기준은 ICLR 평가 척도에서 약한 수락 쪽에 해당하는지 측정하며 실제 학회 결정 자체를 예측하는 지표는 아닙니다.
- 짝지은 비교(Matched Comparison)
- — 같은 논문과 심사 모델, 심사 프롬프트를 유지하면서 원본과 재작성본의 점수 차이를 비교하는 방법입니다. 논문별 과학적 내용 차이를 통제해 표현 변경에 따른 점수 이동을 분리하는 데 사용됩니다.
- 반복 재작성(Recursive Rewriting)
- — 한 차례의 재작성 결과를 다음 재작성의 입력으로 다시 사용하는 절차입니다. 연구에서는 동일한 공동 재작성 프롬프트를 세 라운드 적용해 추가 점수 상승이 언제 둔화되는지 확인합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
