섹션별 상세
에이전트 메모리에 valid_from, valid_to, superseded_by 필드를 추가하여 사실의 전체 이력을 추적할 수 있는 이중 시간 버전 관리를 구현했습니다. 개발자가 수동으로 supersede()를 호출하여 사실 관계를 정리하던 기존 방식에서 나아가, LLM이 자동으로 사실의 유효성을 판단하는 단계를 도입했습니다.
자동 갱신 시스템은 새로운 메모리 저장 시 의미론적 검색을 통해 유사한 기존 메모리 3개를 추출하고 LLM 분류기로 관계를 정의합니다. 분류기는 '대체(Supersedes)', '보완(Refines)', '독립(Independent)'의 세 가지 판결을 내리며, 신뢰도가 0.85 이상인 '대체' 판결에 대해서만 기존 메모리를 만료 처리합니다.
근거
- 시스템은 신뢰도가 0.85 이상인 경우에만 자동으로 메모리를 대체합니다. — How the classifier actually decides 섹션의 8번 항목
데이터 손실을 방지하기 위해 전체 정확도보다 '대체' 판결에 대한 정밀도(Precision)를 최적화하는 전략을 채택했습니다. 잘못된 대체로 인한 데이터 유실(False Positive)은 복구가 불가능하지만, 갱신 누락(False Negative)은 수동으로 수정 가능한 노이즈로 간주하여 안전성을 확보했습니다.
의료 및 법률 상태와 같은 민감한 카테고리는 LLM의 판단에 맡기지 않고 코드 수준에서 결정론적으로 자동 갱신 대상에서 제외합니다. 사용자는 API 키 설정을 통해 제외 카테고리를 추가하거나 최소 신뢰도 임계값을 상향 조정하여 시스템의 보수성을 직접 제어할 수 있습니다.
121개의 테스트 케이스를 통해 벤치마크를 수행한 결과, Claude 3.5 Haiku 모델이 100%의 정밀도와 91.7%의 재현율을 기록하며 최적의 모델로 선정되었습니다. 이는 더 고성능인 Sonnet 모델보다 비용은 3배 저렴하고 지연 시간은 3배 빨라 실시간 메모리 처리에 적합한 성능을 보여주었습니다.
근거
- Claude 3.5 Haiku 모델은 자동 갱신 판결에서 100%의 정밀도를 기록했습니다. — The numbers 섹션의 벤치마크 결과 표
기술
- Claude 3.5 Haiku
- Claude 3.5 Sonnet
- Python SDK
- npm SDK
- Aurra
활용 사례
- 사용자 선호도가 자주 바뀌는 개인화 챗봇
- 상태 변화가 잦은 B2B 영업 지원 에이전트
- 과거 시점의 데이터 감사가 필요한 규제 산업용 AI
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 04.수집 2026. 05. 04.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
