길이 악용
토큰 수준 이득을 시퀀스 전체로 합산하는 목적함수 구조가 길이에 민감한 최적화를 허용하는 현상이다. 학생이 정답 추론 대신 응답을 잘라내거나 불필요한 패딩으로 이득을 조작하여 보상을 극대화하는 행동으로 나타난다. 본문은 이 현상이 OPD 훈련을 붕괴시키는 주요 병리 중 하나라고 규정하였다.