본문으로 건너뛰기

LLM 메모리 검색을 위한 정밀도 중심 벤치마크 'PrecisionMemBench'와 'Tenure'

LLM 메모리 시스템의 검색 정밀도를 독립적으로 측정하는 PrecisionMemBench와 이를 해결하는 구조적 신념 저장소 Tenure를 제안한다.

섹션별 상세

기존 LLM 메모리 벤치마크는 검색 시스템의 독립적 성능을 측정하지 못하고 최종 답변 품질에만 의존한다. 이는 단위 테스트와 통합 테스트의 차이를 구분하지 못하는 구조적 문제로, 검색 시스템이 잘못된 정보를 반환해도 답변이 맞으면 통과되는 오류를 범한다.
PrecisionMemBench는 생성 모델과 독립적으로 검색 정밀도를 측정하는 89개 케이스의 벤치마크이다. 이 벤치마크는 다양한 범위, 변이, 격리 주장을 통해 기존 메모리 시스템의 낮은 정밀도(0.05~0.08)를 명확히 드러낸다.
근거
  • 기존 메모리 시스템은 자체 추출을 참조하는 경우 0.05에서 0.08의 평균 검색 정밀도를 기록한다. Abstract, 4번째 문장 출처
코사인 유사도 기반의 검색은 도메인 특화 말뭉치에서 관련 신념과 의미적으로 근접한 정보를 구분하지 못한다. 이는 임베딩 모델의 규모를 20배 확장해도 해결되지 않는 구조적 한계로, 다중 턴 대화에서 의미적 정보가 섞이는 현상을 유발한다.
Tenure는 다중 경로 BM25, 분석기 비대칭성, 차등 부스팅, 하드 스코프 격리를 활용한 로컬 우선 구조적 신념 저장소이다. 이 시스템은 모든 테스트 케이스를 통과하며 15ms 미만의 지연 시간을 달성하여 기존 벡터 데이터베이스 기반 시스템의 비효율성을 극복한다.
근거
  • Tenure는 89/89 케이스를 통과하며 평균 정밀도 1.0과 15ms 미만의 검색 지연 시간을 기록한다. Abstract, 9번째 문장 출처

기술

  • PrecisionMemBench
  • Tenure
  • LoCoMo
  • BM25

활용 사례

  • LLM 메모리 시스템 평가
  • 고정밀 RAG 시스템 구축
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 04.수집 2026. 06. 04.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.