고정된 인식 인코더
사전학습된 강력한 비전 인코더를 파라미터 고정 상태로 정렬 목표로 사용하는 구성으로, 본문에서는 DINOv2나 CLIP 계열의 인코더를 동결한 뒤 토크나이저의 잠재를 이 인코더의 표현 쪽으로 당겼다. 이렇게 하면 토크나이저가 의미적·구조적 정보를 보존하는 잠재를 학습하게 되어 긴 예측 지평선에서의 상태 보존성이 향상된다. 동결된 타깃을 사용하는 이유는 인코더의 표현이 이미 의미적 거리를 잘 포착하기 때문이다.