자기 SpectraReward
통합 멀티모달 모델 내의 이해(읽기) 분기를 동일 모델의 생성(쓰기) 분기의 보상 모델로 사용하는 특수 사례로, 외부 보상 모델이나 추가 레이블 없이 폐쇄 루프 형식으로 정책을 개선한다. 토크나이저와 비전 인코더를 공유함으로써 보상과 정책 간 분포 정렬을 강화한다. 모델 내부의 정렬이 외부 대규모 보상기보다 더 효과적일 수 있음을 시사한다.