용어 해설
- 궤적 수준 KL 손실(Trajectory-level KL)
- — 행동 궤적 전체에 대해 교사 정책과 학생 정책의 확률 분포 차이를 누적하여 계산하는 손실로서 시퀀스 초기 토큰들이 전체 손실에서 큰 비중을 차지하면 심층 의사결정(turn)에 대한 신호가 약해지는 문제가 발생한다.
- 롤아웃 깊이(Rollout Depth)
- — 에이전트가 한 에피소드에서 시뮬레이션이나 교사 예측을 수행하는 최대 시간 단계 수로서, 불필요하게 긴 롤아웃은 후반 턴에서 잡음이 많은 신호만 수집하여 계산 자원을 낭비한다는 점에서 예산 조절이 중요하다.
- 턴 정규화 손실(Turn-Normalized Loss)
- — 토큰 수준 손실을 단일 턴 단위로 재정규화하여 각 턴이 학습 신호에 균등하게 기여하도록 가중치를 조정하는 방법으로서, 깊은 결정을 충분히 학습시키는 목적을 가진다.
- 교사-학생 프레임워크(Teacher-Student Framework)
- — 성능이 더 좋은 교사 모델의 행동이나 확률 분포를 학생 모델이 모방하도록 학습시키는 구조로서 온-정책 증류에서는 학생의 자가 생성 궤적에서 교사와의 분포 차이를 최소화한다는 점이 핵심이다.
- 실시간(월클록) 학습 예산(Wall-Clock Training Budget)
- — 실험 환경에서 실제 경과 시간 기준으로 할당된 학습 자원으로서 동일한 월클록 예산 하에서 효율적으로 정확도를 올리는 기법은 실무적인 의미가 크다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.