본문으로 건너뛰기

QVal: 장기 지평 LLM 에이전트용 밀집 감독 신호의 저비용 평가

장기 지평의 에이전트 과업에서는 최종 보상만으로는 중간 행동의 가치를 식별하기 어렵기 때문에 밀집 감독 신호가 학습에 필수적인 정보를 제공한다. 기존 평가 방식은 각 신호를 실제 RL 파이프라인에 통합해 학습 성능을 비교했기 때문에 비용이 크고 감독 신호 자체의 질과 학습 엔지니어링 요소가 뒤섞였다. QVal은 학습을 거치지 않고 참조 정책의 Q값과의 정렬성(Q-alignment)을 직접 측정해 신호의 본질적 품질을 빠르게 판별할 수 있다.

용어 해설

밀집 감독 신호(Dense Supervision)
밀집 감독 신호는 장기 궤적의 중간 시점(중간 상태나 행동)에 점수를 할당하여 최종 보상만으로는 포착하기 힘든 행동의 가치를 촘촘하게 평가하는 방법이다. 이 논문에서는 토큰 확률, 자기 증류, 임베딩 유사도, 코드 기반 평가 등 여러 방식으로 점수를 산출하여 비교한다. 밀집 신호는 긴 시간 지평선에서 어떤 중간 행동이 최종 성과에 기여하는지를 더 잘 알려 학습과 탐색에 추가 정보를 제공한다.
Q 정렬(Q-alignment)
Q 정렬은 한 방법이 상태-행동 쌍에 부여하는 스코어가 참조 정책의 Qπ(s,a) 값의 단조증가 함수와 일치하는 정도를 뜻한다. QVal은 이 정렬 정도를 순위 상관(주로 Spearman ρ)으로 측정하여 신호의 질을 평가한다. 정렬이 높으면 그 신호가 후속 RL 학습에서 유용한 밀집 보강 신호일 가능성이 높다.
참조 정책(Reference Policy)
참조 정책은 상태-행동 쌍에 대해 Qπ(s,a)를 산출하는 데 사용되는 연속 정책으로, 가능한 한 최적에 가깝게 설정하여 높은 Q 값이 진짜 높은 가치임을 보장한다. QVal은 환경별로 최적 스크립트, 플래너, 또는 MVMC로 얻은 강한 모델 기반 정책을 참조 정책으로 사용한다. 참조 정책은 평가 라벨을 생성할 때만 필요하며 이후 신호 활용 시 동일 정책을 요구하지 않는다.
최대값 몬테카를로(Max-Value Monte Carlo)
최대값 몬테카를로는 동일한 시작 상태에서 여러 번 참조 정책으로 롤아웃한 뒤 관측된 반환들 중 최대값을 라벨로 채택하는 전략이다. TerminalBench처럼 최적 정책을 직접 얻기 어려운 경우 MVMC(k=16 등)를 사용해 근사적인 높은 보장값을 얻는다. 이 방식은 확률적 정책의 우수한 연속을 포착하려는 목적에서 사용된다.
상태-행동 쌍(State-Action Pair)
상태-행동 쌍은 에이전트가 관찰한 특정 상태와 그 상태에서 취한 특정 행동을 말하며 QVal에서는 각 샘플의 기본 단위가 된다. 각 샘플은 참조 정책에 따른 Qπ(s,a) 라벨과 함께 평가 대상 방법의 스코어를 비교하는 입력이 된다. 다수의 후보 행동을 동일한 상태에서 샘플링해 순위 상관을 계산할 수 있게 구성한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 30.수집 2026. 07. 02.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.