Representation Drift
표현 드리프트
학습이 진행되면서 모델 내부 표현이 변해 기존 probe가 감지하던 개념과 활성 패턴의 대응이 약해지는 현상입니다. 정렬 관련 RL이 probe의 일반화를 훼손할 수 있으며, 정규화나 anchoring으로 개념 표현을 보존하는 방안이 연구 과제로 제시됩니다.
표현 드리프트
학습이 진행되면서 모델 내부 표현이 변해 기존 probe가 감지하던 개념과 활성 패턴의 대응이 약해지는 현상입니다. 정렬 관련 RL이 probe의 일반화를 훼손할 수 있으며, 정규화나 anchoring으로 개념 표현을 보존하는 방안이 연구 과제로 제시됩니다.