용어 해설
- 길이 기반 보상(Length-based Reward)
- — 정답 여부와 별개로 출력 토큰 수를 줄이려는 목표의 보상 항목으로, 모델의 추론 길이를 제어하도록 설계된다.
- 그룹 정규화(Group Normalization)
- — 다양한 보상의 스케일 차이를 완화하고, 보상 간 비교를 안정화하는 정규화 기법으로, 각 보상을 개별적으로 정규화한 뒤 합친다.
- 잠재적-스케일링 불안정성(Potential-Scaled Instability (PSI))
- — 각 보상의 불안정성과 남은 여강(headroom)을 곱해 가중치를 온라인으로 조정하는 지표로, 정보성 있는 신호에 더 많은 학습 용량을 부여한다.
- 목표 길이(L*q*)(Target Length (L*q*))
- — 정답 가능한 롤아웃에서 계산된 문제별 평균 길이로, 각 프롬프트의 적절한 추론 길이를 동적으로 설정하는 기준점이다.
- 문제별 보정(Per-Problem Calibration)
- — 전역 예산 대신 각 프롬프트의 특성에 맞춰 목표 길이와 보상 구성을 조정하는 기법이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


