AML-memory/agent-memory-leaderboard
Python0 / 0
Add/Search API로 장기 기억 시스템을 표준 조건에서 평가하는 공개 플랫폼입니다.
TL;DR
AML-memory/agent-memory-leaderboard는 장기 기억 시스템을 공통 조건에서 비교하는 독립형 연구·평가 플랫폼의 공개 릴리스입니다. 참가자는 Add와 Search API를 구현하고, AML은 답변 생성·평가·집계·실행 조정을 고정해 시스템별 기억 성능을 측정합니다. Textual Memory와 Coding Memory 트랙이 있으며, 공개 레포에는 평가 계약과 일부 모듈만 있고 벤치마크 원본·정답·비공개 코딩 자료는 없습니다. 직접 사용할 라이브러리나 프로덕션 서비스가 아니라 자체 memory system을 리더보드에 제출하거나 평가 방법을 검토하려는 팀에 적합합니다.
핵심 포인트
- 독립 실행형 도구보다 장기 기억 시스템을 비교하는 연구·평가 플랫폼에 가깝습니다. Add와 Search 두 API만 연결하면 됩니다. 자체 서비스나 일반 애플리케이션에 바로 붙이는 라이브러리는 아닙니다.
- 참가 시스템은 대화나 문서를 Add로 저장하고 질의를 Search로 검색합니다. AML이 답변 생성과 채점 조건을 고정합니다. 시스템 간 점수 차이를 기억 기능 자체에 귀속시키려는 구조입니다.
- Textual Memory는 여러 데이터셋과 장기 대화·개인화·시간 정보·규칙 준수를 평가합니다. Coding Memory는 같은 저장소의 과거 디버깅 경험과 설계 결정을 재사용하는지를 측정합니다. 코딩 트랙의 비공개 자료는 레포에 없습니다.
- 공개 레포에는 평가 계약과 일부 실행 구성이 있지만 원본 데이터와 정답은 포함되지 않습니다. 결과 공개 전 호환성 테스트와 전체 평가 및 검토가 필요합니다. 기억 시스템의 재현 가능한 비교가 목적일 때 적합합니다.
566
Stars
11
Forks
+209
Trending
0
조회수
566 watchers2 open issues
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.