용어 해설
- On-Policy Self-Distillation(OPSD)
- — 모델이 생성한 샘플 중 정답과 일치하는 것을 증류하여 학습하는 기법이다. 모델의 정책을 스스로 생성한 고품질 데이터로 정렬하여 성능을 높인다.
- Test-Time Training(TTT)
- — 추론 단계에서 모델의 가중치를 추가로 조정하여 특정 작업 성능을 높이는 기법이다. 외부 레이블 없이 모델의 자체적인 적응력을 활용한다.
- Grouped RL
- — 여러 샘플 그룹을 비교하여 강화학습을 수행하는 방식이다. 샘플 간의 불일치를 보상 신호로 활용하여 모델의 오류를 교정한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

