본문으로 건너뛰기
r/LLMDevs조회 1

에이전트용 Postgres 기반 메모리 레이어를 구축하고 LongMemEval에서 벤치마크한 사례

Postgres에 저장되는 에이전트 메모리 구현체가 LongMemEval 500문제 전체 평가에서 73.6% QA 정확도를 기록했고 재현 가능한 리포지토리를 공개했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

에이전트용으로 Postgres 기반 메모리 레이어를 구현해 LongMemEval의 500문제 오라클 서브셋으로 종단 간 평가한 결과 73.6%의 QA 정확도가 기록되었고 결과 재현을 위한 한 명령 허니스를 리포지토리에 공개했다. 초기 샘플링 평가가 점수를 부풀린 사례가 보고되었으며 샘플링 편향 때문에 회귀 테스트에서 무의미해질 수 있음이 확인되었다. 구현에서는 출처 간 모순 처리, 낮은 신뢰도 추출의 비저장 정책, full-text와 시맨틱 검색의 결합이 성능에 큰 영향을 미쳤다. 이 사례는 메모리 시스템 평가에서 전체 재현성 확보와 저장·검색 정책의 명확화가 성능 신뢰도에 직접적으로 연결된다는 점을 보여주었다.

실용적 조언

  • 벤치마크는 가능하면 전체 오라클 서브셋으로 종단 간 평가를 수행해 샘플링 편향을 피해야 한다.
  • 저장 정책에서 추출 신뢰도 임계값을 설정해 낮은 신뢰도 정보를 배제하면 메모리 오염을 줄일 수 있다.
  • 레트리벌 단계에서 full-text 매칭과 임베딩 기반 유사도를 결합하여 후보 생성을 하고 후속 랭킹을 통해 정답 후보를 걸러내는 방식이 유효하다.

섹션별 상세

01
구성과 재현성 문제가 초기 평가를 왜곡했다는 점이 주요 문제였다. 원문은 샘플링된 하위집합으로 먼저 평가했을 때 점수가 부풀려졌고 전체 500문제 oracle 서브셋으로 끝까지 돌려 73.6% QA 정확도를 얻었다고 적시했다. 이 과정에서 한 명령으로 재현 가능한 허니스를 공개해 결과 검증을 가능하게 만들었다. 샘플링 결과가 회귀 테스트에 무용하다는 주장이 실무적 관점에서 제기되었다.
02
메모리 품질을 저해하는 세부 요인으로 모순 처리 방식이 지목되었다. 두 출처가 상충할 때 이를 조용히 방치하면 답변 정확도가 급감하는 구조적 문제가 발생하며 이 문제를 줄이기 위해 출처 간 비교와 우선순위 규칙이 필요하다고 보고되었다. 또한 낮은 신뢰도의 추출을 저장하지 않는 정책이 전체 정확도에 긍정적 영향을 미친 사례가 제시되었다. 이러한 처리 규칙들은 메모리의 신뢰성과 장기적 누적 오류를 관리하는 핵심 수단으로 평가되었다.
03
검색 전략 측면에서는 전문형(full-text) 검색과 시맨틱 검색의 결합이 단독 사용보다 나은 결과를 냈다고 기록되었다. 구현은 문서 전체 텍스트 일치 신호와 임베딩 기반 의미 유사도 신호를 함께 조회해 후보를 생성하고 재랭킹하는 방식으로 작동한다. 이 결합이 QA 정확도 변화에 유의미한 기여를 했으며 단일 기법만 사용할 때보다 회복력을 보였다. 따라서 레트리벌 설계에서 혼합 신호를 고려하는 것이 실무상 이점으로 나타났다.
04
커뮤니티에 묻는 형태로 평가 지표와 검증 관행의 개선 필요성이 제기되었다. 작성자는 'vibes'를 넘는 메모리 품질 평가법을 찾고자 했고 샘플링된 벤치마크 결과가 회귀 테스트에서 쓸모없다는 경험을 공유했다. 이 발언은 벤치마크 샘플링, 전체 재현성, 오라클 서브셋의 역할에 대한 토론을 촉발할 수 있는 실질적 문제 제기로 읽힌다. 결과적으로 벤치 도구와 허니스 공개가 신뢰성 확보의 핵심 방안으로 부각되었다.

용어 해설

시맨틱 검색(Semantic Search)
텍스트를 의미 공간으로 임베딩한 뒤 코사인 유사도 등으로 검색하는 방식으로, 단어 일치가 아닌 의미 유사도를 기준으로 관련 문서를 찾아낸다. 이 글에서는 메모리 레트리벌 단계에서 full-text 검색과 결합해 성능을 올리는 용도로 쓰였다. 시맨틱 검색은 긴 컨텍스트에서 관련 단서를 찾는 데 중요하다.
전문형 검색(Full-Text Search)
문서 전체의 단어 매칭과 순위화(예: TF-IDF, BM25)를 통해 관련 문서를 찾아내는 방식으로, 정확한 문자열 매칭에 강점이 있다. 글에서는 시맨틱 검색과 결합해 보완적으로 사용한 점이 성능에 영향을 미쳤다. 긴 질의에 대해서는 키워드 기반 신호가 여전히 유용할 수 있다.
추출 신뢰도(Extraction Confidence)
원문에서 구조화된 사실이나 엔티티를 뽑아낼 때 모델이 산출하는 신뢰도 점수로, 낮은 신뢰도의 추출을 저장하지 않으면 메모리 오염을 줄일 수 있다. 글에서는 낮은 신뢰도 추출을 저장하지 않는 정책이 성능에 큰 영향을 미쳤다고 기록되었다. 신뢰도 기준은 저장·검색 단계의 정확도와 직결된다.
모순 처리(Contradiction Resolution)
서로 다른 소스가 상충하는 정보를 제공할 때 어느 쪽을 우선하거나 추가 검증을 통해 정합성을 확보하는 절차로, 무시하면 답변 정확도가 급격히 떨어질 수 있다. 글에서는 모순하는 두 출처가 조용히 공존하면 QA 성능을 크게 저하시킨다고 보고되었다. 메모리 시스템에서는 출처 간 대조와 신뢰도 기반 선택이 필요하다.

언급된 도구

Postgres중립

메모리 레이어의 영구 저장소로 사용됨

myco-brain추천링크

Postgres 기반 메모리 레이어 구현체 및 재현 가능한 벤치 허니스

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 21.수집 2026. 07. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.