용어 해설
- 메모리(Memory)
- — 롱컨텍스트에서의 정보 보존 및 재사용을 담당하는 핵심 구성요소로, Chunk 단위로 처리되는 문서에서 중요한 사실을 기억하고 업데이트하는 역할을 수행한다.
- 메모리 오버라이트(Memory-overwriting)
- — 이전 기억이 새로운 정보에 의해 덮어써지는 현상으로, 초기에 포착된 단서가 뒤에 등장하더라도 잃어버려 활용할 수 없게 된다.
- 재읽기(Rereading)
- — 메모리에서 누락된 정보를 보완하기 위해 서브질문(sub-question)을 생성하고 재독을 수행하는 절차. 읽기와 추론의 분리 원칙에서 핵심 역할을 한다.
- GRPO
- — Rereading의 과정 보상 설계로, 같은 결과를 가진 트레이젝토리에는 간소화된 rereading을, 부분적으로 정답에 도달한 경우에는 추가 rereading을 유도하는 Decoupled Reward Policy Optimization의 약자.
- Rereading-Adaptive GRPO(ReA-GRPO)
- — Rereading-Adaptive Outcome Advantage와 GRPO를 결합한 학습 전략으로, 경우에 따라 rereading 횟수를 적응적으로 조절한다.
코드 예제
1: Require: Backbone Model LLM, reading template TR, answering template TA, decomposing template TD and integrating templte TI
2: function MEMORIZEWHILEREADING(q, C) ▷ q is the question. C is the list of context chunks
3: m = NO_MEMORY
4: for c in C do
5: m ← LLM(TR(q, m, c))
6: end for
7: return m
8: end function
9:
10: function ANSWER(q, m) ▷ q is the question. m is the final memory after reading all chunks.
11: a ← LLM(TA(Q, m, c))
12: return a
13: end function
14:
15: function MEMREREAD(Q, C, p) ▷ Q is the question. C is the list of ci, i = 0, 1, ..., T − 1. p is
16: the rereading passes limit.
17: M ← MEMORIZEWHILEREADING(Q, C)
18: qa ← [ ] ▷ qa is a list of historical subquestion-answers.
19: for i = 1 to p do
20: d ← LLM(TD(Q, M, qa))
21: if not HASQUESTION(d) then ▷ Rule-based question matching.
22: break
23: end if
24: q ← PARSEQUESTION(d) ▷ Rule-based question parsing.
25: m ← MEMORIZEWHILEREADING(q, C)
26: a ← ANSWER(q, m)
27: M ← LLM(TI (Q, M, q, a))
28: qa ← qa + [(q, a)]
29: end for
30: A ← ANSWER(Q, M)
31: return A
32: end functionMemReread의 작동 흐름을 요약하는 알고리즘으로, 읽기-분해-통합-답변의 네 단계에 걸쳐 서브질문 생성과 재읽기를 반복한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.







