용어 해설
- 정보 비대칭(Information Asymmetry)
- — 교사-학생 간 privileged context 차이에 의해 형성되는 정보 비대칭이 학습 신호로 작용하는 현상을 뜻한다. 교사는 c로 보강된 분포를 제공하고 학생은 이를 without-context 로 학습하므로, 토큰 수준의 신호 차이가 학습 방향과 탐색을 좌우한다.
- Self-Distillation
- — 한 모델이 교사와 학생 역할을 모두 수행하며 privileged context를 이용해 토큰 수준의 지식을 전달하는 방법이다. 실패 롤아웃에선 교사가 보완 정보를, 성공 롤아웃에선 교사 추종이 학생의 독립적 추론을 억제하는 문제점이 있다.
- RLVR
- — Reinforcement Learning with Verifiable Rewards의 약자로, 강화학습-LLM에서 verifiable reward를 활용해 학습하는 프레임워크를 뜻한다.
- RLRT
- — RLVR에서 교사의 신호를 역방향으로 읽는 RLRT( RLVR with Reversed Teacher ) 알고리즘으로, 성공 롤아웃에서 학생이 교사와 다르게 선택한 토큰을 증폭하는 탐색 신호를 제공한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
