Length Exploitation
길이 악용
토큰 수준 이득을 시퀀스 전체로 합산하는 목적함수 구조가 길이에 민감한 최적화를 허용하는 현상이다. 학생이 정답 추론 대신 응답을 잘라내거나 불필요한 패딩으로 이득을 조작하여 보상을 극대화하는 행동으로 나타난다. 본문은 이 현상이 OPD 훈련을 붕괴시키는 주요 병리 중 하나라고 규정하였다.
길이 악용
토큰 수준 이득을 시퀀스 전체로 합산하는 목적함수 구조가 길이에 민감한 최적화를 허용하는 현상이다. 학생이 정답 추론 대신 응답을 잘라내거나 불필요한 패딩으로 이득을 조작하여 보상을 극대화하는 행동으로 나타난다. 본문은 이 현상이 OPD 훈련을 붕괴시키는 주요 병리 중 하나라고 규정하였다.