용어 해설
- 밀집 감독 신호(Dense Supervision)
- — 밀집 감독 신호는 장기 궤적의 중간 시점(중간 상태나 행동)에 점수를 할당하여 최종 보상만으로는 포착하기 힘든 행동의 가치를 촘촘하게 평가하는 방법이다. 이 논문에서는 토큰 확률, 자기 증류, 임베딩 유사도, 코드 기반 평가 등 여러 방식으로 점수를 산출하여 비교한다. 밀집 신호는 긴 시간 지평선에서 어떤 중간 행동이 최종 성과에 기여하는지를 더 잘 알려 학습과 탐색에 추가 정보를 제공한다.
- Q 정렬(Q-alignment)
- — Q 정렬은 한 방법이 상태-행동 쌍에 부여하는 스코어가 참조 정책의 Qπ(s,a) 값의 단조증가 함수와 일치하는 정도를 뜻한다. QVal은 이 정렬 정도를 순위 상관(주로 Spearman ρ)으로 측정하여 신호의 질을 평가한다. 정렬이 높으면 그 신호가 후속 RL 학습에서 유용한 밀집 보강 신호일 가능성이 높다.
- 참조 정책(Reference Policy)
- — 참조 정책은 상태-행동 쌍에 대해 Qπ(s,a)를 산출하는 데 사용되는 연속 정책으로, 가능한 한 최적에 가깝게 설정하여 높은 Q 값이 진짜 높은 가치임을 보장한다. QVal은 환경별로 최적 스크립트, 플래너, 또는 MVMC로 얻은 강한 모델 기반 정책을 참조 정책으로 사용한다. 참조 정책은 평가 라벨을 생성할 때만 필요하며 이후 신호 활용 시 동일 정책을 요구하지 않는다.
- 최대값 몬테카를로(Max-Value Monte Carlo)
- — 최대값 몬테카를로는 동일한 시작 상태에서 여러 번 참조 정책으로 롤아웃한 뒤 관측된 반환들 중 최대값을 라벨로 채택하는 전략이다. TerminalBench처럼 최적 정책을 직접 얻기 어려운 경우 MVMC(k=16 등)를 사용해 근사적인 높은 보장값을 얻는다. 이 방식은 확률적 정책의 우수한 연속을 포착하려는 목적에서 사용된다.
- 상태-행동 쌍(State-Action Pair)
- — 상태-행동 쌍은 에이전트가 관찰한 특정 상태와 그 상태에서 취한 특정 행동을 말하며 QVal에서는 각 샘플의 기본 단위가 된다. 각 샘플은 참조 정책에 따른 Qπ(s,a) 라벨과 함께 평가 대상 방법의 스코어를 비교하는 입력이 된다. 다수의 후보 행동을 동일한 상태에서 샘플링해 순위 상관을 계산할 수 있게 구성한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





