용어 해설
- 기준 유출(Criterion Leakage)
- — 질문에 포함된 정보만으로 평가 기준을 추론할 수 있는 현상입니다. 질문과 정답·평가 기준을 같은 문서 내용에서 만들면 모델이 연구 계획의 실제 품질을 높이지 않고 질문을 바꿔 쓰는 방식으로 보상을 얻을 수 있습니다. PaperGym은 문서의 서로 다른 구간에서 질문과 기준을 추출해 이를 줄입니다.
- 온폴리시 자기 증류(On-Policy Self-Distillation)
- — 모델이 직접 생성한 응답의 토큰별 분포를 교사와 학생 역할로 비교해 학습하는 방법입니다. 교사는 정답이나 Rubric 같은 추가 정보를 보고, 학생은 문제와 생성 접두부만 본 상태에서 교사의 분포를 따릅니다. 전체 응답 하나의 점수보다 조밀한 학습 신호를 제공합니다.
- 그룹 상대 정책 최적화(Group Relative Policy Optimization)
- — 여러 응답을 한 그룹으로 생성한 뒤 각 응답의 보상을 그룹 평균과 비교해 정책을 갱신하는 강화학습 방법입니다. 별도의 학습된 Critic 없이 그룹 내 상대적 우수성을 Advantage로 계산하며, PaperGym에서는 Rubric의 기준별 판정을 응답 보상으로 사용합니다.
- Rubric 기반 보상(Rubric-as-Rewards)
- — 응답 품질을 하나의 총점이 아니라 여러 평가 기준으로 나누고, 각 기준의 충족 여부를 보상으로 바꾸는 방식입니다. PaperGym은 연구 방법과 실험 설계를 반영한 전문 기준 및 완성도·구체성·타당성 등을 평가하는 일반 기준을 함께 사용합니다.
- 연구 계획 생성(Research Plan Generation)
- — 연구 목표를 가설·방법·실험으로 구체화하는 작업입니다. 정답이 하나로 고정되지 않아 자동 채점이 어렵지만, 논문에 기록된 연구 문제와 해결 방법을 활용하면 후보 계획을 평가할 학습 환경을 만들 수 있습니다. PaperGym은 이 과정을 질문, 기준, 보상으로 구조화합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

