본문으로 건너뛰기

MemReread: MemReread를 통한 메모리 가이드 재독으로 에이전트의 롱-컨텍스트 추론 강화

대형 언어 모델의 긴 컨텍스트 처리에서 Self-Attention의 제곱 복잡도 문제를 해결하기 위해 메모리 기반 접근이 제안되었다. 그러나 과거 재검색 기반 메모리 시스템은 초기에 중요한 정보를 잃거나 잘못된 질의로 인해 노이즈가 누적되기 쉽다. MemReread는 streaming reading을 유지하되 최종 메모리가 부족하면 sub-question으로 이진 탐색적 rereading을 수행하여 잃어버린 사실을 복구하고, 읽기-추론의 구분을 통해 정보의 흐름을 보존한다. 또한 Rereading-Adaptive GRPO를 도입해 필요에 따라 rereading 횟수를 동적으로 조절하므로 계산 비용을 선형적으로 유지한다. 실험에서 길이가 긴 컨텍스트에서 baselines를 능가하고, 각종 long-context 벤치마크에서 강한 일반화 성능을 보였다.

용어 해설

메모리(Memory)
롱컨텍스트에서의 정보 보존 및 재사용을 담당하는 핵심 구성요소로, Chunk 단위로 처리되는 문서에서 중요한 사실을 기억하고 업데이트하는 역할을 수행한다.
메모리 오버라이트(Memory-overwriting)
이전 기억이 새로운 정보에 의해 덮어써지는 현상으로, 초기에 포착된 단서가 뒤에 등장하더라도 잃어버려 활용할 수 없게 된다.
재읽기(Rereading)
메모리에서 누락된 정보를 보완하기 위해 서브질문(sub-question)을 생성하고 재독을 수행하는 절차. 읽기와 추론의 분리 원칙에서 핵심 역할을 한다.
GRPO
Rereading의 과정 보상 설계로, 같은 결과를 가진 트레이젝토리에는 간소화된 rereading을, 부분적으로 정답에 도달한 경우에는 추가 rereading을 유도하는 Decoupled Reward Policy Optimization의 약자.
Rereading-Adaptive GRPO(ReA-GRPO)
Rereading-Adaptive Outcome Advantage와 GRPO를 결합한 학습 전략으로, 경우에 따라 rereading 횟수를 적응적으로 조절한다.

코드 예제

text
1: Require: Backbone Model LLM, reading template TR, answering template TA, decomposing template TD and integrating templte TI
2: function MEMORIZEWHILEREADING(q, C) ▷ q is the question. C is the list of context chunks
3: m = NO_MEMORY
4: for c in C do
5: m ← LLM(TR(q, m, c))
6: end for
7: return m
8: end function
9:
10: function ANSWER(q, m) ▷ q is the question. m is the final memory after reading all chunks.
11: a ← LLM(TA(Q, m, c))
12: return a
13: end function
14:
15: function MEMREREAD(Q, C, p) ▷ Q is the question. C is the list of ci, i = 0, 1, ..., T − 1. p is
16: the rereading passes limit.
17: M ← MEMORIZEWHILEREADING(Q, C)
18: qa ← [ ] ▷ qa is a list of historical subquestion-answers.
19: for i = 1 to p do
20: d ← LLM(TD(Q, M, qa))
21: if not HASQUESTION(d) then ▷ Rule-based question matching.
22: break
23: end if
24: q ← PARSEQUESTION(d) ▷ Rule-based question parsing.
25: m ← MEMORIZEWHILEREADING(q, C)
26: a ← ANSWER(q, m)
27: M ← LLM(TI (Q, M, q, a))
28: qa ← qa + [(q, a)]
29: end for
30: A ← ANSWER(Q, M)
31: return A
32: end function

MemReread의 작동 흐름을 요약하는 알고리즘으로, 읽기-분해-통합-답변의 네 단계에 걸쳐 서브질문 생성과 재읽기를 반복한다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 11.수집 2026. 05. 15.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.