본문으로 건너뛰기
r/LLMDevs조회 1

에이전트 간 메모리 공유를 위한 agent-memory-store 공개

에이전트 세션 간 정보를 공유하고 하이브리드 검색을 지원하는 로컬 SQLite 기반 MCP 메모리 저장소인 agent-memory-store가 공개됐다.

커뮤니티 반응

작성자가 직접 개발한 도구의 벤치마크 결과와 기술적 상세 구현 방식을 공유하여 긍정적인 관심을 받고 있으며, 특히 로컬 환경에서의 성능에 주목하고 있습니다.

주요 논점

01찬성다수

로컬 하이브리드 검색을 통해 API 비용 없이도 상용 서비스 수준의 메모리 성능을 낼 수 있다.

합의점 vs 논쟁점

합의점

  • 에이전트 세션 간 맥락 유지가 개발 생산성에 중요하다.
  • 로컬 SQLite 기반 저장 방식이 관리와 이식성 측면에서 유리하다.

실용적 조언

  • npx agent-memory-store 명령어로 즉시 로컬 메모리 서버를 구동하여 MCP 호환 에이전트와 연결할 수 있다.
  • 정확한 용어 매칭이 필요할 때는 BM25 모드를, 의미적 유사성이 중요할 때는 semantic 모드를 활용하라.

섹션별 상세

에이전트 세션 간의 맥락 단절 문제를 해결하기 위해 영구적인 로컬 저장소를 구축했다. 에이전트가 학습한 내용을 기록하고 필요할 때 검색하여 다른 세션이나 다른 에이전트와 협업할 수 있는 구조를 제공한다. npx 명령어로 즉시 실행 가능하며 별도의 API 키나 계정 설정 없이 로컬 SQLite 파일에 모든 데이터를 저장한다. 이를 통해 오케스트레이션 오버헤드 없이 에이전트 간 지식 전파가 가능해졌다.
bash
npx agent-memory-store

별도의 계정이나 API 키 없이 한 줄의 명령어로 에이전트 메모리 저장소를 실행하는 방법

검색 성능을 극대화하기 위해 SQLite FTS5 기반의 BM25와 ONNX Runtime으로 구동되는 로컬 시맨틱 임베딩을 결합한 하이브리드 검색 방식을 채택했다. all-MiniLM-L6-v2 모델을 사용하여 384차원의 임베딩을 생성하고, 이를 Reciprocal Rank Fusion(RRF)으로 통합하여 검색 결과의 정확도를 높였다. 모델 파일은 약 23MB로 최초 1회 다운로드 후 로컬에 캐싱되어 이후 검색은 30ms 이내의 빠른 속도로 수행된다. 사용자는 상황에 따라 하이브리드, BM25 전용, 시맨틱 전용 모드 중 선택할 수 있다.
LongMemEval(ICLR 2025) 벤치마크를 통해 성능을 검증한 결과, API 호출 없이도 높은 수준의 회상률을 기록했다. agent-memory-store는 92.1%의 Recall@5를 기록하며 Gemini를 활용한 Hindsight(91.4%)보다 우수한 성능을 보였다. 특히 GPT-4o-mini를 사용하는 Mastra(94.87%)와 비교해도 격차가 4.77%p에 불과하여 로컬 실행의 효율성을 입증했다. 실제 사용 환경에서 에이전트가 구조화된 데이터를 저장할 경우 벤치마크 수치보다 더 높은 성능을 기대할 수 있다.
Apple Silicon 환경에서 측정한 성능 지표에 따르면 대규모 데이터셋에서도 실시간 처리가 가능하다. BM25 모드에서 쓰기 작업은 약 0.2ms가 소요되며, 읽기 작업은 5만 개의 청크까지 1ms 미만으로 처리된다. 2만 5천 개 이하의 일반적인 에이전트 워크로드에서 검색 시간은 30ms 미만으로 유지된다. 모든 데이터는 단일 store.db 파일에 저장되어 관리가 용이하고 git을 통한 버전 관리도 가능하다.

용어 해설

모델 컨텍스트 프로토콜(MCP)
AI 모델이 로컬 데이터나 외부 도구와 상호작용할 수 있도록 설계된 개방형 표준 프로토콜이다. 에이전트가 파일 시스템, 데이터베이스, API 등에 일관된 방식으로 접근하게 하여 개발 생산성을 높이는 역할을 한다.
BM25
문서 내 단어 빈도와 희소성을 기반으로 검색어와의 관련성을 계산하는 통계적 랭킹 알고리즘이다. 키워드 일치 여부를 판단하는 전통적인 텍스트 검색 기법으로, 정확한 용어 매칭이 중요한 경우에 주로 사용된다.
상호 순위 결합(Reciprocal Rank Fusion)
서로 다른 검색 알고리즘(예: BM25와 시맨틱 검색)의 결과 순위를 하나로 통합하는 기법이다. 각 결과의 순위 역수를 합산하여 최종 순위를 결정함으로써, 각 검색 방식의 장점을 결합하고 검색 품질을 안정화한다.
ONNX 런타임(ONNX Runtime)
다양한 프레임워크에서 학습된 머신러닝 모델을 여러 하드웨어 가속기에서 최적화된 성능으로 실행할 수 있게 돕는 고성능 엔진이다. 로컬 환경에서 임베딩 모델 등을 저지연으로 실행하기 위해 사용된다.

언급된 도구

agent-memory-store추천링크

에이전트용 로컬 하이브리드 검색 메모리 저장소

all-MiniLM-L6-v2추천

로컬 시맨틱 임베딩 생성을 위한 경량 모델

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 11.수집 2026. 04. 11.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.