용어 해설
- 토큰-수준 KL 발산(Token-level KL Divergence)
- — autoregressive 생성에서 깨끗한 입력과 degraded 입력 간의 토큰 분포를 KL 발산으로 정합시키는 기법. stop-gradient를 사용해 깨끗한 정책 표현을 보존하면서 degraded 입력과의 분포 차이를 최소화한다.
- 최악의 경우 다중 뷰 최적화(Worst-Case Multi-View Optimization)
- — 여러 degraded 뷰 중 가장 큰 분포 차이를 유도하는 뷰에만 정규화를 적용하는 최적화 전략으로, adversarial한 시각 변화에 대해 모델의 견고함을 강화한다.
- 정확성 조건부 정규화(Correctness-Conditioned Regularization)
- — 정확한 clean 롤아웃이 확보된 경우에만 invariance 정규화를 적용하여, 정합성 없는 강제 일반화를 방지하는 규칙화 기법이다.
- 보조 정책 그래디언트(Auxiliary Policy Gradient)
- — degraded 뷰에 대해 보조 경사 하강법을 수행하되, 클린 이점을 기준으로 앵커링해 보상 신호의 신뢰성을 유지하는 학습 신호이다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


