본문으로 건너뛰기

TurnOPD: 장기간 에이전트의 효율적 온-정책 증류를 위한 턴 단위 예산 전략

TurnOPD는 프로브 기반 턴 통계를 이용한 적응형 롤아웃 깊이 예산과 턴 균형화된 KL 가중치 전이를 결합해 동일 월클록 예산에서 vanilla OPD보다 검증 정확도를 향상시켰다.

용어 해설

궤적 수준 KL 손실(Trajectory-level KL)
행동 궤적 전체에 대해 교사 정책과 학생 정책의 확률 분포 차이를 누적하여 계산하는 손실로서 시퀀스 초기 토큰들이 전체 손실에서 큰 비중을 차지하면 심층 의사결정(turn)에 대한 신호가 약해지는 문제가 발생한다.
롤아웃 깊이(Rollout Depth)
에이전트가 한 에피소드에서 시뮬레이션이나 교사 예측을 수행하는 최대 시간 단계 수로서, 불필요하게 긴 롤아웃은 후반 턴에서 잡음이 많은 신호만 수집하여 계산 자원을 낭비한다는 점에서 예산 조절이 중요하다.
턴 정규화 손실(Turn-Normalized Loss)
토큰 수준 손실을 단일 턴 단위로 재정규화하여 각 턴이 학습 신호에 균등하게 기여하도록 가중치를 조정하는 방법으로서, 깊은 결정을 충분히 학습시키는 목적을 가진다.
교사-학생 프레임워크(Teacher-Student Framework)
성능이 더 좋은 교사 모델의 행동이나 확률 분포를 학생 모델이 모방하도록 학습시키는 구조로서 온-정책 증류에서는 학생의 자가 생성 궤적에서 교사와의 분포 차이를 최소화한다는 점이 핵심이다.
실시간(월클록) 학습 예산(Wall-Clock Training Budget)
실험 환경에서 실제 경과 시간 기준으로 할당된 학습 자원으로서 동일한 월클록 예산 하에서 효율적으로 정확도를 올리는 기법은 실무적인 의미가 크다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 07.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.