용어 해설
- 전략 넛지(Strategy Nudging)
- — 전략 수준의 컨텍스트를 입력에 첨부해 롤아웃 생성 시 서로 다른 추론 모드를 의도적으로 탐색하게 하는 탐색 기법이다. 이로써 학습 중에 드물고 다양한 해결 전략을 노출시키고, 이후 기본 프롬프트로의 일반화 가능성을 높인다.
- 인터-인트라 그룹 어드밴티지(Inter-Intra Group Advantage)
- — _CONTEXT--conditioned_ 롤아웃을 여러 그룹으로 나눈 뒤, 그룹 내부와 그룹 간의 보상을 모두 고려해 크레딧을 분배하는 값산 기법이다. 서로 다른 컨텍스트 간의 편향을 보정하고 일관된 학습 신호를 유도한다.
- 디스틸레이션 보강 RL 목표(Distillation-Augmented RL Objective)
- — -context-conditioned_ 탐색에서 발견된 고-가치 행동을 base 프롬프트의 정책으로 디스틸링하여 일반화시키는 학습 목표다. LDistill를 통해 효과적인 행동만 정책에 반영한다.
- 특권 정보(Privileged Information)
- — 오라클 솔루션이나 중간 해답과 같은 외부 신호에 의존하는 학습 방식의 한계를 설명하는 용어다. 본 연구는 이와 달리 컨텍스트 기반의 다양성 탐색에 초점을 맞춘다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.



