TL;DR
ALTK‑Evolve와 ACE는 에이전트의 과거 궤적에서 교훈을 추출해 추론 시 문맥으로 재사용하는 같은 원칙을 공유하지만, 저장소를 통합하는 방식과 모델에 전달하는 방식에서 차이가 있다. ACE는 하나의 통합된 플레이북을 매 스텝에 주입하는 반면 ALTK‑Evolve는 지지 횟수가 높은 핵심 항목을 고정으로 주입하고 과업별로 소수의 관련 교훈만 선택해 주입하거나 능력 여유가 있을 때만 전체 집합을 보낸다. AppWorld 벤치에서 ALTK‑Evolve는 강한 모델에서 높은 정확도와 낮은 토큰을 동시에 달성했고 약한 모델에서는 정확도를 유지하면서 토큰을 크게 절감했다; 결론적으로 동일한 교훈을 담되 전달을 캘리브레이션하면 동일하거나 더 나은 성능을 훨씬 적은 비용으로 얻을 수 있다.
섹션별 상세
이미지 분석

왼쪽 패널은 약한 모델(gpt‑oss‑120b)에서 ACE와 ALTK‑Evolve의 TGC를 난이도별로 비교해 주며, ALTK‑Evolve가 Hard에서 우위지만 Easy·Medium에서는 ACE가 약간 앞선 점을 보여준다. 오른쪽 패널은 강한 모델(DeepSeek‑V3.2)에서 ALTK‑Evolve가 Easy·Hard·Overall에서 ACE를 앞서는 반면 Medium에서는 ACE가 근소하게 우세한 패턴을 보여, 모델 역량에 따른 전달량 조절이 결과에 영향을 줬다는 본문의 주장을 시각적으로 뒷받침한다.
난이도별 메모리 효과 바 차트

산점도는 총 비용 대비 태스크 정확도를 표시하며 우리 라우터(Our router)와 두 가지 라우터 구성(configurations)을 통해 비용‑정확도 트레이드오프를 시각화한다. 그림 안의 주석과 삽입된 분포 막대는 특정 구성에서 모델 분배 비율(gpt‑oss‑120b, claude‑sonnet‑4.6, claude‑opus‑4.7 등)을 보여 주며, 본문에서 주장한 '선택적 검색이 비용을 크게 낮추면서 같은 수준의 정확도를 유지'한다는 점을 보완한다.
비용 대비 정확도 산점도와 라우터 구성 분포
용어 해설
- 에이전트식 메모리(Agentic memory)
- — 에이전트가 과거 수행 궤적에서 규칙과 회복 전략을 추출해 추론 시 재사용하는 방식으로, 가중치 업데이트나 사람 레이블 없이 과거 행동에서 배운 교훈을 문장 형태로 보관하고 재주입한다.
- 플레이북 통합(Playbook consolidation)
- — 실패·복구 사례에서 생성된 여러 교훈을 하나의 통합된 저장소로 합쳐 중복을 병합하고 교훈별로 지지 횟수(provenance/support)를 유지해 나중에 조회 가능한 단일 플레이북을 만든다는 개념이다.
- 선택적 검색(Selective retrieval)
- — 모델 능력과 과업 요구에 맞춰 보관된 교훈의 일부만을 검색해 문맥에 주입하는 전략으로, 전체 플레이북을 항상 주입하는 대신 모델이 실제로 소화 가능한 분량만 전달해 토큰 비용을 줄인다.
- 지지 횟수(Support counts)
- — 각 교훈이 몇 개의 독립적 에피소드에서 도출되었는지를 세는 계수로, 단일 발생의 규칙과 여러 번 관찰된 규칙을 구별해 저장소에서 압축 없이 중요도를 판단하는 근거로 쓴다.
- AppWorld 벤치마크(AppWorld benchmark)
- — 168개 과제로 구성된 테스트셋으로 ReAct 코드 에이전트를 대상으로 TGC(Task Goal Completion)와 SGC(Scenario Goal Completion) 같은 지표로 메모리기술의 효과를 측정하는 내부 평가 환경이다.
근거 모음
- ALTK‑Evolve는 DeepSeek‑V3.2에서 TGC 89.3, SGC 80.4를 기록하며 ACE(80.4/73.2)보다 높은 정확도를 보였고 토큰 비용은 263K로 ACE의 634K보다 크게 낮았다. — 본문의 AppWorld 결과 표(‘DeepSeek‑V3.2 — test_normal’)와 본문 단락의 숫자 요약을 확인하면 된다; 표 행 ReAct + ACE 및 ReAct + ALTK‑Evolve의 TGC, SGC, Tokens/task 수치가 근거다.
- gpt‑oss‑120b(약한 모델)에서는 ALTK‑Evolve가 ACE와 유사한 TGC(56.0 대 54.8)를 달성하면서 토큰은 116K로 ACE의 777K보다 훨씬 적게 사용했다. — 본문의 AppWorld 결과 표(‘gpt‑oss‑120b — test_normal’) 및 by‑difficulty 표의 gpt‑oss‑120b 항목에서 TGC와 Tokens/task 수치를 확인할 것.
- ACE는 매 단계에 통합된 전체 플레이북을 주입하는 반면 ALTK‑Evolve는 모델 능력과 과업에 맞춰 핵심 항목과 소수의 선택된 교훈만을 검색해 주입하는 전달 정책을 사용했다. — 본문의 'Delivery (what reaches the model at inference)' 단락과 비교 설명, 그리고 토큰 원인이 설명된 절을 근거로 삼을 것.
기술
- ALTK‑Evolve
- ACE
- DeepSeek‑V3.2
- gpt‑oss‑120b
- ReAct
- AppWorld benchmark
활용 사례
- 엔터프라이즈 멀티스텝 작업 자동화에서 에이전트가 과거 실패로부터 배운 규칙을 재사용해 오류를 줄이는 상황
- 모델 능력에 따라 전달할 문맥량을 조정해 추론 토큰 비용을 절감하려는 서비스 운영
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
