본문으로 건너뛰기

에이전트 메모리는 모델 역량에 맞춰 투입량을 조절해야 한다.

ALTK-Evolve는 모델별로 메모리 투입량을 조절해 에이전트 성능과 비용을 함께 최적화한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

ALTK-Evolve는 에이전트의 과거 성공과 실패 궤적에서 행동 지침을 자기 증류하고, 모델 가중치를 바꾸지 않은 채 추론 컨텍스트에 재주입하는 Agentic Memory 방식이다. AppWorld의 585개 다단계 작업 평가에서 강한 모델은 전체 지침 세트, 약한 모델은 핵심 지침과 작업별 검색을 결합한 curated retrieval에서 더 큰 효과를 냈으며, GLM-5처럼 포화된 모델은 변화가 없었다. gpt-oss-120b는 curated retrieval로 TGC가 39.9%에서 56.0%로 16.1%포인트 상승했고 토큰 오버헤드는 5%에 그쳤다. 전체 지침을 반복 입력할 때 생기는 비용은 prompt caching으로 낮출 수 있지만, 컨텍스트 윈도 크기와 모델 역량의 관계를 분리하는 추가 실험이 필요하다.

섹션별 상세

ALTK-Evolve는 에이전트가 AppWorld 작업을 수행하며 남긴 성공과 실패 궤적에서 재사용 가능한 행동 지침을 추출하고, 이를 통합한 뒤 추론 시점에 다시 컨텍스트로 제공하는 구조이다. 모델 가중치를 업데이트하거나 사람이 라벨을 붙이지 않으며, 전체 지침 세트를 매 단계 넣거나 작업별로 필요한 일부만 검색하는 두 가지 전달 방식을 사용한다. 따라서 메모리의 핵심은 과거 대화를 그대로 재생하는 데 있지 않고, 모델이 이후 작업에서 활용할 전략과 예외 처리 규칙을 외부 지침으로 공급하는 데 있다.
모델 역량에 따라 효과적인 메모리 용량이 달라지는 세 가지 패턴이 AppWorld 평가에서 반복됐다. 여유 성능이 있는 강한 모델은 드문 예외 지침까지 포함한 전체 지침 세트를 활용했으며, DeepSeek-V3.2는 TGC가 79.8%에서 89.3%로 9.5%포인트, SGC가 64.3%에서 80.4%로 16.1%포인트 상승했다. 상대적으로 약한 gpt-oss-120b는 전체 세트보다 고신뢰 핵심 지침과 작업별 검색 결과를 결합한 curated retrieval에서 더 큰 효과를 냈고, GLM-5처럼 이미 포화된 모델은 추가 지침에 따른 측정 가능한 변화가 없었다.
선택적 검색은 gpt-oss-120b에서 정확도와 비용을 동시에 개선하는 방식으로 작동했다. 기준선의 TGC 39.9%가 curated retrieval 적용 뒤 56.0%로 16.1%포인트 상승했으며, 작업당 토큰은 110K에서 116K로 늘어 오버헤드가 5%에 그쳤다. 반면 전체 지침 세트는 166K 토큰으로 약 51%의 오버헤드를 만들었으므로, 약한 모델에서는 더 많은 정보를 주는 것이 성능과 비용 모두에 유리하지 않았다.
근거
  • DeepSeek-V3.2는 전체 지침 세트에서 TGC가 79.8%에서 89.3%로 9.5%포인트, SGC가 64.3%에서 80.4%로 16.1%포인트 상승했다. 본문의 세 가지 패턴 비교 표와 SGC 해설 문단에 DeepSeek-V3.2의 수치가 제시돼 있다.
  • GLM-5는 메모리 적용 전후 TGC 87.5%, SGC 80.4%로 측정 가능한 변화가 없었다. 본문의 모델별 패턴 표에서 GLM-5의 Saturated 패턴과 0.0 변화 수치를 확인할 수 있다.
평가는 9개 가상 앱에서 585개의 다단계 AppWorld 작업을 대상으로 진행됐으며, 개별 작업의 완전 성공을 재는 TGC와 모든 변형 작업을 통과해야 하는 SGC를 함께 사용했다. 메모리 지침은 AppWorld 학습 분할에서 한 번 채굴됐고 테스트 분할 데이터는 지침 생성에 사용되지 않아 데이터 누출을 피했다. SGC에서 DeepSeek-V3.2는 16.1%포인트, GPT-5.5는 7.2%포인트, Claude Opus 4.6은 7.1%포인트 상승해 평균 작업 성공률보다 신뢰성 지표에서 효과가 더 크게 나타났다.
AppWorld test_normal에서 다섯 모델의 기준선과 메모리 적용 결과를 비교한 막대형 도표이다.
Chart도표는 gpt-oss-120b에서 curated retrieval이 39.9%에서 56.0%로 올라 16.1%포인트 개선된 반면, DeepSeek-V3.2는 79.8%에서 89.3%, Claude Opus 4.6은 90.5%에서 94.6%, GPT-5.5는 92.3%에서 95.2%로 상승했음을 나타낸다. GLM-5는 87.5%에서 변화가 없어 모델 역량과 남은 성능 여유에 따라 유효한 메모리 용량이 달라진다는 본문의 세 패턴을 시각적으로 뒷받침한다.
근거
  • gpt-oss-120b는 curated retrieval 적용으로 TGC가 39.9%에서 56.0%로 16.1%포인트 상승했고 토큰 오버헤드는 5%였다. 본문의 결과 표와 비용 표에서 gpt-oss-120b의 baseline, curated retrieval, TGC, Tokens/task 수치를 확인할 수 있다.
  • AppWorld 평가는 9개 가상 앱의 585개 다단계 작업으로 구성되며 TGC와 SGC를 함께 사용했다. Results Across the Spectrum 절의 평가 데이터 설명과 Appendix의 지표 정의에 관련 내용이 있다.
전체 지침 세트의 비용 증가는 주로 에이전트가 더 오래 추론해서가 아니라 매 ReAct 단계마다 입력 지침을 반복 전송해서 발생했다. DeepSeek-V3.2의 메모리 사용 전후 평균 ReAct 단계 수는 약 18~19개로 비슷했으며, 작업당 토큰은 148K에서 263K로 78% 늘었다. 글은 고정 지침 접두부를 동일하게 유지하는 prompt caching을 적용하면 반복 입력 비용을 낮출 수 있다고 제안하면서도, 컨텍스트 윈도 크기와 모델 역량의 영향을 분리한 통제 실험은 아직 남아 있다고 밝혔다.
총 비용과 작업 정확도의 관계를 비교하면서 라우터 구성별 모델 분포와 비용·지연 수치를 함께 표시한 산점도이다.
Chart산점도는 gpt-oss-120b가 낮은 비용과 낮은 정확도 지점에 있고, Claude 계열 모델과 라우터 구성이 비용 증가에 따라 더 높은 정확도 영역에 분포함을 나타낸다. 삽입된 막대는 지연 우선 라우터 구성 1이 gpt-oss-120b 5%, Claude Sonnet 4.6 35%, Claude Opus 4.7 60%의 모델 분포를 사용함을 보여주지만, 본문의 핵심 AppWorld 메모리 비교보다 모델 라우팅 비용·정확도 관계에 가까운 자료이다.
근거
  • DeepSeek-V3.2의 평균 ReAct 단계 수는 메모리 사용 전후 약 18~19개로 비슷했고, 토큰 증가는 입력 지침 반복에서 발생했다. 비용 분석 절의 Memory doesn't blow up the reasoning loop 문단에 단계 수와 비용 증가 원인이 명시돼 있다.

용어 해설

에이전트 메모리(Agentic Memory)
에이전트 메모리는 과거 실행 궤적에서 재사용 가능한 지침을 추출해 추론 시점의 컨텍스트에 다시 주입하는 방식이다. 모델 가중치를 업데이트하지 않고 성공 전략, 회피해야 할 실수, 예외 상황을 지침 세트로 관리하므로 여러 모델에 적용하기 쉽지만, 모델 역량에 맞는 메모리 양 조절이 중요하다.
자기 증류(Self-Distillation)
자기 증류는 에이전트가 자신의 과거 성공 및 실패 궤적에서 행동 지침을 추출하고 이를 이후 작업에 재사용하는 과정이다. ALTK-Evolve에서는 사람이 라벨을 제공하거나 모델 가중치를 재학습하지 않고, 실행 결과에서 재사용 가능한 전략을 정리해 추론 입력에 반영한다.
프롬프트 캐싱(Prompt Caching)
프롬프트 캐싱은 여러 요청이나 추론 단계에서 반복되는 입력의 일부를 저장해 동일한 토큰을 다시 처리하는 비용을 줄이는 기법이다. 이 글에서는 여러 ReAct 단계에 반복되는 고정 지침 세트의 접두부를 안정적으로 유지하면 입력 토큰 비용을 낮출 수 있다고 설명한다.
ReAct 루프(ReAct Loop)
ReAct 루프는 에이전트가 작업을 여러 단계로 나누어 추론하고 도구를 호출하면서 목표를 수행하는 실행 과정이다. 메모리 지침을 매 단계 입력에 포함하면 모델의 행동 선택에 영향을 주지만, 지침을 반복 전송하므로 입력 토큰 비용이 증가할 수 있다.
시나리오 목표 완료율(Scenario Goal Completion)
Scenario Goal Completion(SGC)은 같은 시나리오에 속한 여러 변형 작업을 모두 성공한 시나리오의 비율이다. 개별 작업의 성공률을 계산하는 TGC보다 엄격한 올오어낫싱 지표이므로, 한 변형이라도 실패하면 해당 시나리오는 통과로 집계되지 않는다.

기술

  • ALTK-Evolve
  • AppWorld
  • ReAct
  • cosine similarity
  • prompt caching

활용 사례

  • 다단계 도구 사용 에이전트
  • 캘린더·메시징·결제 앱 자동화
  • 과거 실행 경험을 재사용하는 엔터프라이즈 에이전트

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 19.수집 2026. 08. 19.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.