토큰화 드리프트
데이터 수집(롤아웃) 단계에서 생성된 텍스트를 학습 단계에서 다시 토큰화할 때 원래의 토큰 시퀀스와 달라지는 현상이다. 이는 모델이 실제로 경험한 데이터와 학습하는 데이터 사이의 불일치를 유발하여 학습 성능을 저하시킨다. ProRL AGENT는 토큰 ID를 직접 전달하여 이 문제를 원천 차단한다.