본문으로 건너뛰기

TREK: 검증된 제안으로 탐색 지지 확장하고 GRPO로 정제하는 학습 절차

TREK은 검증된 제안 샘플을 선별해 짧은 forward-KL로 학생 정책의 샘플링 지지를 넓힌 뒤 GRPO로 정제하여 하드 프롬프트와 에이전트 과제에서 학습 속도와 최종 성능을 개선했다.

용어 해설

정방향 KL(Forward KL)
정방향 KL은 제안 분포(q_prop)와 학생 정책(π_θ) 사이의 KL(q_prop ∥ π_θ)를 최소화하여 학생이 제안된 성공 궤적 모드를 샘플할 확률을 높이는 목적함수이다. 이 목적은 제안된 검증된 출력들의 로그확률을 학생이 높이도록 직접적으로 패널티를 부과한다. TREK에서는 짧은 warm-start 단계에서 forward KL을 적용해 학생의 샘플링 지지(support)를 확장하는 데 사용됐다.
그룹 상대 정책 최적화(Group Relative Policy Optimization)
GRPO는 하나의 프롬프트에서 여러 후보 응답을 샘플하고 검증자 보상으로 그룹 정규화된 우위(advantage)를 계산해 학생 정책을 직접 최적화하는 온-폴리시 계열의 방법이다. 상대적 이득 스케일링과 클리핑된 중요비(ρ)를 사용해 배치 내 행동을 조정하며 학습과 배포 간 동작 일치를 유지한다. TREK은 GRPO가 이미 샘플 가능한 유용 모드를 가정할 때 탐색 부족으로 멈추는 실패 모드를 겨냥했다.
도달성 점수(Reachability Score)
도달성 점수는 학생 정책이 특정 검증된 궤적을 생성할 확률적 근접성을 나타내기 위해 토큰별 음의 로그우도(NLL)를 잘라낸 평균으로 계산되는 정규화된 거리 지표이다. 상·하위 트림을 적용해 보일러플레이트나 희귀 토큰 이상치를 제거한 후 평균을 구하며, 값이 작을수록 학생의 현재 지원(support)에서 가까운 궤적임을 뜻한다. 이 점수는 제안된 검증 궤적 중 학생에게 통합하기 적합한 상위 r개를 선별하는 기준으로 사용됐다.
검증된 롤아웃(Verified Rollout)
검증된 롤아웃은 외부 검증자(verifier)로 성공 판정을 받은 응답 또는 행동 궤적을 뜻한다. TREK은 오직 이 성공 신호를 통과한 출력만을 제안 데이터로 저장하여 학생에게 통합시키므로 블랙박스 제안자도 활용 가능하다. 검증 기준은 문제 유형에 따라 정답 일치, 환경 성공 신호 등으로 정의된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 06.수집 2026. 07. 09.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.