TL;DR
긴호라이즌 에이전트의 의사결정은 과거의 정보가 시점에 따라 다르게 필요해진다. SAM은 메모리 큐를 통해 현재 상태에서 필요한 과거 정보를 선택적으로 회상하고, 원시 trajectory 페이지를 외부에 보관함으로써 백본 모델의 재학습 없이도 긴 히스토리를 재구성한다. 이로써 정보의 재현성과 적시성 사이의 균형을 달성하고, 추론 정확도와 효율성을 높인다.
왜 중요한가
긴호라이즌 에이전트의 의사결정은 과거의 정보가 시점에 따라 다르게 필요해진다. SAM은 메모리 큐를 통해 현재 상태에서 필요한 과거 정보를 선택적으로 회상하고, 원시 trajectory 페이지를 외부에 보관함으로써 백본 모델의 재학습 없이도 긴 히스토리를 재구성한다. 이로써 정보의 재현성과 적시성 사이의 균형을 달성하고, 추론 정확도와 효율성을 높인다.
핵심 기여
상태 적응형 메모리 프레임워크 제시
장의 추론에서 필요 시 과거 정보를 재구성하는 외부 메모리 모듈 SAM을 도입하고, 두 가지 뷰(메모리 큐 + raw trajectory 페이지)로 구성해 온라인 컨텍스트를 경량화한다.
cue-page 메모리 아키텍처
쓰기 시 페이지를 큐로 압축하고, 읽기 시 현재 의도에 맞춰 큐를 선택해 페이지를 재구성하는 의도 기반 회상을 수행한다.
OAT-GRPO로 메모리 학습 최적화
메모리 호출 트리를 구성하고, Oracle-anchored recoverability 보상으로 회상 출력의 품질에 크레딧을 부여하는 트리 구조의 강화학습 objective를 제안한다.
핵심 아이디어 이해하기
단계 1: 긴 호라이즌 추론에서는 전체 히스토리를 컨텍스트에 다 담을 수 없으며, 초기 정보가 나중에 중요해질 수 있다. 단계 2: SAM은 페이지 단위로 최근 대화를 ‘페이지(p)로 묶어’ 큐 m으로 요약하고, 원시 페이지는 외부 저장소 Pt에 보관한다. 단계 3: 필요 시 qt를 통해 의도에 맞는 큐를 선택하고, Mrec를 통해 관련 페이지를 재구성해 Cet에 주입한다. 단계 4: 학습은 expert-guided SFT로 초기화하고, RL(OAT-GRPO)로 기억 호출의 트리 구조와 oracle 기반 보상을 통해 memory model의 정책을 다듬는다.
방법론
전체 접근은 먼저 write-path와 read-path를 분리한 page-based episodic consolidation과 agent-guided cue selection으로 구성된다. 페이지는 토큰 예산에 따라 pk로 묶이고, 각 pk는 mK로 요약된다. 문의(intent qt)에 따라 Mt에서 후보 큐를 선택하고, 페이지를 재구성한 ρt를 active context Cet에 주입한다. 학습은 두 단계로 진행되며, expert traces로 초기화된 후 OAT-GRPO를 통해 memory-action 단위로 정책을 업데이트한다. OAT-GRPO는 (i) memory-call 트리를 구성해 각 자식이 같은 부모 컨텍스트에서 기여를 구분하고, (ii) committee 기반 oracle 평가를 통해 recoverability를 보상에 반영한다.
관련 Figure

WRITE 경로에서 페이지를 생성하고 cue를 생성하는 흐름, READ 경로에서 recall 의도에 따라 페이지를 재구성하는 흐름이 한 눈에 보이며, Cet 구성의 구성 요소를 연결한다.
SAM의 페이지 기반 에피소드 consolidation과 recall 경로를 시각화한 도해
주요 결과
주요 벤치마크에서 SAM은 백본 모델에 관계없이 강력한 컨텍스트 관리 방법으로 작동한다. BrowseComp, BrowseComp-ZH, WideSearch, HLE에서 SAM은 w/o CM 대비 평균 57.0으로 최고치를 기록했고, 같은 백본에서의 gRPC 기반 대조군보다 유의한 성능 향상을 보였다. 예를 들어 SAM(GLM-4.7) 평균 57.0, w/o CM은 49.4, SAM(Qwen3.5-35B) 평균 48.8로 SAM이 우세하다. ablation에서는 SFT와 OAT-GRPO의 두 학습 단계가 서로 보완적임을 보여주며, 27B LoRA 버전도 full-parameter 버전과 근접한 성능을 보인다. 긴 호라이즌에서 추론 초기에 SAM의 회상이 더 큰 이점을 준다(1~80 라운드 구간에서 안정적 우위).
관련 Figure

RECALL 메커니즘과 training stage의 기여를 비교하는 도식으로, SAM의 두 가지 핵심 구성 요소(SFT와 OAT-GRPO)의 중요한 역할을 시사한다.
훈련 단계 및 메모리 읽기 방식의 ablation 결과를 보여주는 차트

트리거 타이밍, 라운드 수, 메모리 페이지 크기 등의 변수에 따른 정확도 변화를 보여 주며 긴 호라이즌에서 memory의 사용 시점을 구체적으로 파악하게 한다.
SAM의 장기 추론에서의 성능 변화(트리거 시점, 페이지 크기 등) 분석 차트
기술 상세
SAM은 페이지 기반 write-path와 recall-read-path로 구성된 외부 메모리 모듈이다. 페이지는 pk로 구분되며, 각 pk는 Msum(pk)로 요약된다. Mt에는 memory cues가 저장되고 Pt에는 원시 페이지가 저장된다. Recall은 qt에 따라 Mk를 선택하고, Mrec(qt, pk1,..,pkr)을 통해 ρt를 얻어 Cet에 삽입한다. 학습은 SFT로 시작해, OAT-GRPO로 memory-action-레벨 RL을 수행하며, tree-구조의 credit 할당과 oracle-anchored recoverability 보상을 결합한다.
한계점
제한점으로 (i) 실험이 소수의 백본과 메모리 구성을 대상으로 제한되며, 더 큰 규모의 메모리 백본과 다양한 아키텍처에 대한 일반화가 필요하다. (ii) frontier 모델 의존성과 온라인 평가의 비용이 크고, 보상 설계의 편향 가능성이 있다. (iii) 웹 기반 벤치마크 중심으로 평가되어 다른 도메인(임베디드/소프트웨어 엔지니어링 등)에서의 일반화 추가 검증이 필요하다. (iv) 메모리 품질의 평가가 주로 간접 신호에 의존하며, recall 목표를 명확히 정의하는 확장 연구가 필요하다.
실무 활용
SAM은 독립적으로 동작하는 외부 메모리 모듈로, 백본 모델의 재학습 없이도 장기 의사결정에 필요한 과거 정보를 의도적으로 회상하도록 돕는다.
- 장거리 웹 탐색 에이전트
- 지식 기반의 연구 보조 에이전트
- 대규모 히스토리를 필요로 하는 소프트웨어 에이전트
- 다양한 백본 간 재사용 가능한 메모리 모듈 도입
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- State-Adaptive Memory
- — 장기 환경에서 의사결정 상태(st)가 요구하는 정보에 맞춰 past trajectory의 정보를 선택적으로 인덱스화하고, 원시 페이지를 보존하면서도 간결한 큐를 통해 필요시 재구성한다. 이로써 현재 상태에 맞춘 기억 접근이 가능해진다.
- Memory Cue
- — 과거 대화의 핵심 조각을 가볍게 남겨두는 지속 가능한 포인터로 작동하며, 필요 시 underlying pages에서 정보를 재구성해 의도 기반의 회상을 가능하게 한다.
- Trajectory Pages
- — Live-context 밖에 저장된 원시 대화 기록으로, 큐를 통해 회상할 때 해당 페이지를 순차적으로 재구성한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

