TL;DR
ALTK-Evolve는 에이전트의 과거 성공과 실패 궤적에서 행동 지침을 자기 증류하고, 모델 가중치를 바꾸지 않은 채 추론 컨텍스트에 재주입하는 Agentic Memory 방식이다. AppWorld의 585개 다단계 작업 평가에서 강한 모델은 전체 지침 세트, 약한 모델은 핵심 지침과 작업별 검색을 결합한 curated retrieval에서 더 큰 효과를 냈으며, GLM-5처럼 포화된 모델은 변화가 없었다. gpt-oss-120b는 curated retrieval로 TGC가 39.9%에서 56.0%로 16.1%포인트 상승했고 토큰 오버헤드는 5%에 그쳤다. 전체 지침을 반복 입력할 때 생기는 비용은 prompt caching으로 낮출 수 있지만, 컨텍스트 윈도 크기와 모델 역량의 관계를 분리하는 추가 실험이 필요하다.
섹션별 상세
- DeepSeek-V3.2는 전체 지침 세트에서 TGC가 79.8%에서 89.3%로 9.5%포인트, SGC가 64.3%에서 80.4%로 16.1%포인트 상승했다. — 본문의 세 가지 패턴 비교 표와 SGC 해설 문단에 DeepSeek-V3.2의 수치가 제시돼 있다.
- GLM-5는 메모리 적용 전후 TGC 87.5%, SGC 80.4%로 측정 가능한 변화가 없었다. — 본문의 모델별 패턴 표에서 GLM-5의 Saturated 패턴과 0.0 변화 수치를 확인할 수 있다.

- gpt-oss-120b는 curated retrieval 적용으로 TGC가 39.9%에서 56.0%로 16.1%포인트 상승했고 토큰 오버헤드는 5%였다. — 본문의 결과 표와 비용 표에서 gpt-oss-120b의 baseline, curated retrieval, TGC, Tokens/task 수치를 확인할 수 있다.
- AppWorld 평가는 9개 가상 앱의 585개 다단계 작업으로 구성되며 TGC와 SGC를 함께 사용했다. — Results Across the Spectrum 절의 평가 데이터 설명과 Appendix의 지표 정의에 관련 내용이 있다.

- DeepSeek-V3.2의 평균 ReAct 단계 수는 메모리 사용 전후 약 18~19개로 비슷했고, 토큰 증가는 입력 지침 반복에서 발생했다. — 비용 분석 절의 Memory doesn't blow up the reasoning loop 문단에 단계 수와 비용 증가 원인이 명시돼 있다.
용어 해설
- 에이전트 메모리(Agentic Memory)
- — 에이전트 메모리는 과거 실행 궤적에서 재사용 가능한 지침을 추출해 추론 시점의 컨텍스트에 다시 주입하는 방식이다. 모델 가중치를 업데이트하지 않고 성공 전략, 회피해야 할 실수, 예외 상황을 지침 세트로 관리하므로 여러 모델에 적용하기 쉽지만, 모델 역량에 맞는 메모리 양 조절이 중요하다.
- 자기 증류(Self-Distillation)
- — 자기 증류는 에이전트가 자신의 과거 성공 및 실패 궤적에서 행동 지침을 추출하고 이를 이후 작업에 재사용하는 과정이다. ALTK-Evolve에서는 사람이 라벨을 제공하거나 모델 가중치를 재학습하지 않고, 실행 결과에서 재사용 가능한 전략을 정리해 추론 입력에 반영한다.
- 프롬프트 캐싱(Prompt Caching)
- — 프롬프트 캐싱은 여러 요청이나 추론 단계에서 반복되는 입력의 일부를 저장해 동일한 토큰을 다시 처리하는 비용을 줄이는 기법이다. 이 글에서는 여러 ReAct 단계에 반복되는 고정 지침 세트의 접두부를 안정적으로 유지하면 입력 토큰 비용을 낮출 수 있다고 설명한다.
- ReAct 루프(ReAct Loop)
- — ReAct 루프는 에이전트가 작업을 여러 단계로 나누어 추론하고 도구를 호출하면서 목표를 수행하는 실행 과정이다. 메모리 지침을 매 단계 입력에 포함하면 모델의 행동 선택에 영향을 주지만, 지침을 반복 전송하므로 입력 토큰 비용이 증가할 수 있다.
- 시나리오 목표 완료율(Scenario Goal Completion)
- — Scenario Goal Completion(SGC)은 같은 시나리오에 속한 여러 변형 작업을 모두 성공한 시나리오의 비율이다. 개별 작업의 성공률을 계산하는 TGC보다 엄격한 올오어낫싱 지표이므로, 한 변형이라도 실패하면 해당 시나리오는 통과로 집계되지 않는다.
기술
- ALTK-Evolve
- AppWorld
- ReAct
- cosine similarity
- prompt caching
활용 사례
- 다단계 도구 사용 에이전트
- 캘린더·메시징·결제 앱 자동화
- 과거 실행 경험을 재사용하는 엔터프라이즈 에이전트
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
