섹션별 상세
기존 LLM 서비스는 세션이 종료되면 맥락을 잊어버리는 휘발성 메모리 문제를 가지고 있었다. Memoryport는 모든 대화 턴을 캡처하여 LanceDB에 로컬 저장하고 Arweave에 암호화된 상태로 영구 백업한다. 이를 통해 사용자는 기기를 이동하거나 데이터를 삭제하더라도 과거의 모든 지식과 선호도를 유지할 수 있다. AI가 사용자의 장기적인 맥락을 이해하게 함으로써 진정한 개인화 비서 구현이 가능해진다.
대규모 데이터셋에서도 실시간 응답성을 보장하기 위해 고성능 벡터 검색 아키텍처를 채택했다. 5억 개의 토큰(약 133만 개의 청크)을 대상으로 한 브루트 포스 검색에서 p50 지연 시간 294ms를 기록했다. 근사 인덱싱 없이 100% 재현율을 달성하여 정보 손실 없는 정확한 맥락 추출이 이루어진다. 로컬 임베딩 모델인 nomic-embed-text를 활용해 외부 API 호출 비용과 지연을 최소화했다.

근거
- 500M 토큰 환경에서 p50 쿼리 지연 시간 294ms를 달성했다. — Performance 섹션의 테이블 및 performance_chart.png 출처
- LongMemEval 벤치마크에서 97.9%의 세션 재현율(Session Recall)을 기록했다. — Benchmarks 섹션의 Session Recall 테이블
다양한 LLM 도구와의 호환성을 위해 멀티 프로토콜 API 프록시 서버를 운영한다. 단일 포트(9191)에서 Anthropic, OpenAI, Ollama의 API 형식을 모두 수용하여 투명하게 메시지를 가로채고 맥락을 주입한다. Claude Code나 Cursor 같은 개발 도구에서 환경 변수 설정만으로 즉시 메모리 기능을 활성화할 수 있다. MCP 서버 지원을 통해 에이전트가 직접 메모리 도구를 호출하여 능동적으로 정보를 검색하는 구조를 갖췄다.
bash
curl -fsSL https://memoryport.ai/install | sh
uc initMemoryport CLI 설치 및 초기 설정 마법사 실행 명령어
bash
OLLAMA_HOST=http://127.0.0.1:9191 ollama run llama3Ollama를 Memoryport 프록시를 통해 실행하여 대화를 자동 캡처하는 방법
검색 효율을 높이기 위해 단일 턴(Single-turn)과 멀티 턴(Multi-turn) 두 가지 검색 모드를 제공한다. 단일 턴 모드는 프록시가 질문과 관련된 맥락을 자동으로 주입하여 LLM에 전달하는 방식이다. 멀티 턴 모드는 LLM이 스스로 검색 도구를 사용하여 필요한 정보를 찾을 때까지 반복적으로 쿼리하는 에이전트 방식을 취한다. 복잡한 질문에 대해 여러 소스의 정보를 조합하여 답변해야 하는 경우 멀티 턴 방식이 더 높은 정확도를 보인다.
toml
[retrieval]
max_context_tokens = 50000
similarity_top_k = 50
recency_window = 20
gating_enabled = true검색 성능 및 게이팅 설정을 포함한 Memoryport 구성 파일 예시
개인정보 보호를 위해 강력한 로컬 암호화 및 논리적 삭제 메커니즘을 구현했다. 모든 데이터는 AES-256-GCM 방식으로 암호화되며 암호화 키는 사용자의 로컬 환경에만 저장된다. Arweave에 저장된 영구 데이터는 키가 없으면 해독이 불가능하며, 삭제 요청 시 로컬 키만 파괴하여 데이터를 영구적으로 읽을 수 없게 만든다. 이는 영구 저장소의 특성과 사용자의 잊혀질 권리를 기술적으로 조화시킨 설계이다.
용어 해설
- 벡터 검색(Vector Search)
- — 데이터를 다차원 공간의 벡터로 변환하여 의미적 유사성을 기반으로 정보를 찾는 기술이다. LLM이 과거 대화 내용 중 질문과 가장 관련성이 높은 맥락을 빠르게 추출하는 데 핵심적인 역할을 한다. 단순 키워드 매칭보다 문맥 이해도가 높아 정확한 정보 회수가 가능하다.
- 모델 컨텍스트 프로토콜(MCP)
- — AI 모델이 외부 도구나 데이터 소스와 표준화된 방식으로 상호작용할 수 있게 하는 프로토콜이다. Memoryport는 MCP 서버를 통해 Claude Code나 Cursor 같은 에이전트가 직접 메모리를 쿼리하고 저장할 수 있는 인터페이스를 제공한다. 이를 통해 도구 간 상호운용성을 극대화한다.
- 지연 시간(Latency)
- — 시스템에 요청을 보낸 후 응답을 받기까지 걸리는 시간을 의미한다. LLM 메모리 시스템에서는 방대한 데이터 중 필요한 정보를 검색하는 속도가 사용자 경험을 결정짓는 핵심 지표이다. Memoryport는 수억 개의 토큰에서도 밀리초 단위의 낮은 지연 시간을 유지하도록 설계되었다.
- 재현율(Recall)
- — 모델이 찾아야 할 전체 관련 정보 중 실제로 찾아낸 정보의 비율을 나타내는 지표이다. LLM 메모리에서 100% 재현율은 과거의 중요한 정보를 하나도 놓치지 않고 검색했음을 의미한다. 이는 AI의 답변 정확도와 신뢰성을 보장하는 데 필수적인 성능 지표이다.
- 임베딩(Embedding)
- — 텍스트와 같은 비정형 데이터를 컴퓨터가 이해할 수 있는 수치 벡터로 변환하는 과정이다. Memoryport는 nomic-embed-text 모델을 사용하여 대화 내용을 벡터화하고 이를 LanceDB에 저장한다. 의미적으로 유사한 문장들이 벡터 공간에서 가깝게 위치하게 하여 효율적인 검색을 가능케 한다.
기술
- LanceDB
- Arweave
- Rust
- Tauri
- Ollama
- Claude Code
- Cursor
활용 사례
- LLM 대화 내역 영구 보관 및 검색
- 로컬 우선 RAG 시스템 구축
- 멀티 에이전트 메모리 공유
- 기기 간 AI 컨텍스트 동기화
언급된 리소스
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 03. 30.수집 2026. 03. 30.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.