본문으로 건너뛰기

Graft: AI 에이전트와 마이크로서비스를 위한 영구 그래프 메모리

Graft는 SQLite와 llama.cpp를 기반으로 AI 에이전트에게 세션 간 유지되는 영구적인 그래프 구조의 메모리를 제공하는 로컬 퍼스트 오픈소스 도구입니다.

섹션별 상세

AI 에이전트가 세션마다 지식을 잊어버리는 문제를 해결하기 위해 로컬 기반의 영구 메모리 계층을 제공합니다. 사용자가 정보를 입력하면 BGE-M3 모델을 통해 임베딩되고 SQLite 데이터베이스에 그래프 노드로 저장되어 세션이 바뀌어도 지식이 유지됩니다. 이를 통해 에이전트는 과거의 디버깅 기록이나 특정 제약 사항을 즉시 다시 불러올 수 있습니다. 별도의 클라우드 계정 없이 단일 SQLite 파일로 모든 데이터를 관리할 수 있어 이식성이 뛰어납니다.
근거
  • BGE-M3 모델과 llama.cpp를 사용하여 CPU 환경에서도 로컬 임베딩 및 검색이 가능합니다. What you get 섹션의 Local-first 설명
검색 성능 최적화를 위해 캐시 우선 전략과 하이브리드 검색 방식을 채택했습니다. 쿼리가 입력되면 먼저 검증된 최상위 매칭을 찾는 캐시 조회를 수행하여 수십 밀리초 내에 결과를 반환하며, 결과가 불확실할 경우에만 전체 검색을 수행합니다. BGE-M3를 이용한 벡터 검색과 FTS5를 이용한 어휘 검색을 RRF(Reciprocal Rank Fusion)로 결합하여 검색 정확도를 높였습니다. 이는 에이전트의 컨텍스트 윈도우에 불필요한 정보를 쏟아붓는 현상을 방지합니다.
마이크로서비스 아키텍처에서 LLM 호출 비용을 절감하기 위한 시맨틱 캐시 레이어로 활용될 수 있습니다. L1(Redis)에서 정확한 매칭을 확인하고, L2(Graft)에서 의미론적 유사성을 검증하며, 마지막 L3에서만 실제 LLM을 호출하는 3단계 구조를 제안합니다. L3에서 생성된 답변은 다시 Graft에 저장되어 다음 유사 요청 시 LLM 호출 없이 즉시 응답할 수 있게 합니다. 내부 테스트 기준 지연 시간을 500ms 이상에서 30~80ms 수준으로 단축하는 효과가 있습니다.
근거
  • Graft는 검증된 시맨틱 캐시 조회를 통해 수십 밀리초(30-80ms) 내에 응답을 반환합니다. The recommended microservice stack 섹션의 L2 레이어 설명
다양한 AI 개발 도구 및 에이전트와의 통합을 위해 MCP(Model Context Protocol) 및 CLI 인터페이스를 지원합니다. Claude Code, ChatGPT, Claude Desktop 등에서 MCP 서버를 통해 Graft의 메모리에 접근하거나 새로운 지식을 저장할 수 있습니다. 각 에이전트별로 독립된 프로필을 생성하여 프로젝트나 업무 성격에 따라 메모리를 격리하여 관리할 수 있습니다. 이는 멀티 에이전트 환경에서 공통된 지식 베이스를 공유하면서도 간섭을 최소화하는 구조입니다.

기술

  • SQLite
  • llama.cpp
  • BGE-M3
  • C11
  • MessagePack
  • FTS5

활용 사례

  • AI 에이전트의 장기 기억 저장소
  • LLM API 비용 절감을 위한 시맨틱 캐시
  • 로컬 지식 베이스 구축

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 12.수집 2026. 05. 12.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.