본문으로 건너뛰기

하이브리드 온/오프 정책 최적화를 통한 탐색적 메모리 증강 LLM 에이전트

기존 LLM 에이전트는 새로운 환경에서 정답을 찾기 위해 시도하기보다 기존 지식에만 의존하는 경향이 있어 복잡한 문제 해결에 한계가 있었다. 이 논문은 에이전트가 스스로 실패를 분석해 메모리에 저장하고 이를 다시 모델의 지능으로 내재화하는 방식을 통해 에이전트의 자율적 탐색 능력을 획기적으로 개선했다.

용어 해설

그룹 상대 정책 최적화(GRPO)
별도의 가치 함수 네트워크 없이 동일한 작업에 대해 여러 번의 시도를 수행하고, 그 결과들의 상대적 보상 차이를 이용해 정책을 업데이트하는 강화학습 기법이다. PPO 대비 연산 자원을 절약하면서도 안정적인 학습이 가능해 대형 언어 모델 정렬에 자주 사용된다.
온 정책 학습(On-policy Learning)
현재 학습 중인 에이전트가 직접 환경과 상호작용하며 얻은 데이터를 즉시 학습에 사용하는 방식이다. 데이터의 분포가 현재 정책과 일치하여 학습이 안정적이지만, 이미 알고 있는 영역만 반복해서 탐색할 위험이 있다.
오프 정책 학습(Off-policy Learning)
과거의 정책이나 다른 에이전트가 생성한 데이터를 학습에 활용하는 방식이다. 데이터 효율성이 높고 다양한 경험을 학습할 수 있지만, 현재 정책과의 분포 차이로 인해 학습 과정이 불안정해질 수 있다.
내재적 보상(Intrinsic Reward)
환경에서 주어지는 최종 성공 보상 외에 에이전트가 스스로 새로운 상태를 발견하거나 참신한 행동을 했을 때 부여하는 보상이다. 외부 보상이 드문 복잡한 환경에서 에이전트가 지치지 않고 탐색을 지속하게 만드는 원동력이 된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 26.수집 2026. 02. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.