본문으로 건너뛰기

효율적인 에이전트적 추론을 위한 자기조절 시뮬레이티브 계획

에이전트의 긴 수평 계획은 성능 향상에 필요하지만 비효율적일 수 있다. 본 연구는 삼중 시스템(I/II/III)으로 의사결정의 계획 존재 여부와 깊이를 학습적으로 조절해 불필요한 deliberation을 줄이고 일반화 가능한 시뮬레이티브 계획 구조를 제시한다. SR2AM은 LLM을 월드 모델로 활용해 도메인별 엔지니어링 없이도 다양한 문제에서 효과적으로 작동한다.

용어 해설

시뮬레이티브 추론(Simulative Reasoning)
시뮬레이티브 추론은 world model을 이용해 제시된 후보 행동의 결과를 미래 상태로 예측하고 그 예측을 기반으로 장기 목표 달성에 기여하는 행위를 계획하는 절차이다. 이는 고정된 체인-오브-생각(COT)과 달리 계획의 존재 여부와 깊이를 학습적으로 조정한다.
월드 모델(World Model)
월드 모델은 관찰로부터 얻은 현재 상태를 바탕으로 제시된 행동의 다음 상태를 예측하는 모듈이다. 시뮬레이티브 플래너가 이 모델을 통해 계획을 구성하고, 계획의 타당성을 검증한다.
계획 수평(호라이즌)(Planning Horizon)
계획 수평은 시뮬레이션에서 예측할 미래 단계의 수를 의미한다. RL 학습은 수평을 증가시키되 계획 빈도 증가를 제한하는 방향으로 작동한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 21.수집 2026. 05. 23.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.