용어 해설
- 에이전트 강화학습(Agentic Reinforcement Learning)
- — AI 모델이 환경과 여러 차례 상호작용하며 최적의 행동 순서를 배우는 강화학습 방식이다. 단발성 답변이 아닌 도구 사용, 웹 탐색 등 연속적인 의사결정이 필요한 작업에 필수적이며, 긴 시퀀스에 따른 학습 불안정성이 주요 과제이다.
- 중요도 샘플링 클리핑(Importance Sampling Clipping)
- — 새로운 정책과 이전 정책의 확률 차이(비율)가 특정 범위를 벗어나지 않도록 제한하는 기법이다. 학습이 급격하게 변해 모델이 망가지는 것을 방지하는 안전장치 역할을 하며, 본 논문에서는 이를 시퀀스 단위로 적용하는 것이 중요함을 밝혔다.
- 학습 붕괴(Training Collapse)
- — 학습 도중 모델의 성능이 갑자기 급락하거나 유효한 출력을 내지 못하게 되는 현상이다. 에이전트 학습처럼 데이터의 변동성이 크고 보상이 희소한 환경에서 정책 업데이트가 잘못된 방향으로 크게 일어날 때 발생한다.
- 어드밴티지 추정(Advantage Estimation)
- — 특정 행동이 평균적인 행동보다 얼마나 더 좋은지를 수치화하는 과정이다. AI가 어떤 행동을 강화해야 할지 결정하는 핵심 지표이며, 환경의 상태 변화를 세밀하게 반영할수록 더 정확한 학습이 가능하다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.