용어 해설
- trajectory-수준 드리프트 무관성(Trajectory-level Drift Agnosticism)
- — 동일한 task reward를 얻는 서로 다른 rollout이 앞선 task 정책 πt−1에 대한 분포 드리프트의 크기가 다르게 나타나는 현상이다. 이 차이는 학습 신호의 방향성과 강도를 다르게 만들어 이전 지식의 보존 정도에 영향을 주며 망각과 밀접한 연관이 있다. 본 연구에서 이를 동일 보상 하의 드리프트 차이에 따른 선택 편향으로 관찰한다.
- Retention 보상(Retention Reward)
- — 앞선-task 정책에 가까운 롤아웃일수록 높은 보상을 주는 트래젝토리 단위 보상으로, Rtask와의 합성으로 총 보상을 구성한다. 이 보상은 보상 기반의 순위 결정에서 드리프트가 큰 롤아웃에 대한 학습 신호를 줄이고, 지식 보존을 강화한다.
- 크로스-태스크 어드밴티지 노멀라이제이션(Cross-Task Advantage Normalization)
- — 태스크 간 경계에서 보상 분포의 스케일이 급격히 변하는 것을 억제하기 위해, 연속적인 EMA로 reward statistics를 누적 보존하고 그룹 내 평균 대비 표준편차로 어드밴티지를 정규화하는 기법이다. 이를 통해 continual learning 중 안정적 크레딧 할당을 유지한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.




