본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
length-based-reward
길이 기반 보상
정답 여부와 별개로 출력 토큰 수를 줄이려는 목표의 보상 항목으로, 모델의 추론 길이를 제어하도록 설계된다.
비슷한 개념
length-penalty
output-length
reinforcement-pre-training
output-tokens
brevity-penalty
verifiable-rewards
target-length
token-level-advantage-normalization
← 용어 사전 전체 보기