본문으로 건너뛰기

Memex(RL): 인덱스 기반 경험 메모리를 통한 장기 작업 LLM 에이전트 확장

장기 작업을 수행하는 LLM 에이전트가 겪는 문맥 창의 한계와 정보 유실 문제를 해결한다. 정보를 단순히 요약하여 압축하는 대신, 인덱스 주소만 남기고 상세 내용은 외부 저장소에 보관했다가 필요할 때만 정확히 찾아 쓰는 방식을 통해 의사결정 품질을 획기적으로 높였다.

용어 해설

문맥 창(Context Window)
LLM이 한 번에 처리할 수 있는 텍스트의 최대 양이다. 장기 작업에서는 이 한계를 초과하는 데이터가 발생하여 과거 정보를 잊거나 연산 비용이 급증하는 병목 현상이 발생한다.
역참조(Dereferencing)
메모리 주소나 인덱스를 통해 실제 데이터 값을 찾아오는 과정이다. 본 논문에서는 에이전트가 요약된 인덱스를 보고 외부 저장소에서 상세 정보를 다시 불러오는 메커니즘을 의미한다.
보상 설계(Reward Shaping)
강화학습에서 에이전트가 원하는 행동을 하도록 보상 함수를 세밀하게 조정하는 기법이다. 여기서는 문맥 오버플로우나 중복 호출에 페널티를 주어 효율적인 메모리 사용을 유도한다.
그룹 상대적 어드밴티지 추정(GRPO)
여러 개의 샘플(rollout)을 생성하여 그들 사이의 상대적인 성능 차이를 바탕으로 모델을 업데이트하는 강화학습 알고리즘이다. 별도의 가치 모델(Value Model) 없이도 효율적인 학습이 가능하다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 05.수집 2026. 03. 06.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.