용어 해설
- 정방향 KL(Forward KL)
- — 정방향 KL은 제안 분포(q_prop)와 학생 정책(π_θ) 사이의 KL(q_prop ∥ π_θ)를 최소화하여 학생이 제안된 성공 궤적 모드를 샘플할 확률을 높이는 목적함수이다. 이 목적은 제안된 검증된 출력들의 로그확률을 학생이 높이도록 직접적으로 패널티를 부과한다. TREK에서는 짧은 warm-start 단계에서 forward KL을 적용해 학생의 샘플링 지지(support)를 확장하는 데 사용됐다.
- 그룹 상대 정책 최적화(Group Relative Policy Optimization)
- — GRPO는 하나의 프롬프트에서 여러 후보 응답을 샘플하고 검증자 보상으로 그룹 정규화된 우위(advantage)를 계산해 학생 정책을 직접 최적화하는 온-폴리시 계열의 방법이다. 상대적 이득 스케일링과 클리핑된 중요비(ρ)를 사용해 배치 내 행동을 조정하며 학습과 배포 간 동작 일치를 유지한다. TREK은 GRPO가 이미 샘플 가능한 유용 모드를 가정할 때 탐색 부족으로 멈추는 실패 모드를 겨냥했다.
- 도달성 점수(Reachability Score)
- — 도달성 점수는 학생 정책이 특정 검증된 궤적을 생성할 확률적 근접성을 나타내기 위해 토큰별 음의 로그우도(NLL)를 잘라낸 평균으로 계산되는 정규화된 거리 지표이다. 상·하위 트림을 적용해 보일러플레이트나 희귀 토큰 이상치를 제거한 후 평균을 구하며, 값이 작을수록 학생의 현재 지원(support)에서 가까운 궤적임을 뜻한다. 이 점수는 제안된 검증 궤적 중 학생에게 통합하기 적합한 상위 r개를 선별하는 기준으로 사용됐다.
- 검증된 롤아웃(Verified Rollout)
- — 검증된 롤아웃은 외부 검증자(verifier)로 성공 판정을 받은 응답 또는 행동 궤적을 뜻한다. TREK은 오직 이 성공 신호를 통과한 출력만을 제안 데이터로 저장하여 학생에게 통합시키므로 블랙박스 제안자도 활용 가능하다. 검증 기준은 문제 유형에 따라 정답 일치, 환경 성공 신호 등으로 정의된다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


