Choice Policies
VLM 내부에서 K개의 후보 행동 청크와 각 후보의 점수를 예측한 뒤, 가장 행동 손실이 작은 후보를 선택하여 회귀 손실에 포함시키는 보조 감독 기법이다. 이 기법은 VLM의 표현을 행동생성에 적합하도록 유도하여 DiT 학습 수렴을 가속하는 역할을 한다.