본문으로 건너뛰기

Lakebase Search: Postgres 기반의 하이브리드 벡터 및 풀텍스트 검색 엔진 발표

Lakebase Search는 계층형 스토리지와 Postgres 네이티브 확장을 통해 에이전트 워크플로에 최적화된 대규모 하이브리드 검색 기능을 제공한다.

섹션별 상세

에이전트 워크플로는 실시간 읽기/쓰기 루프를 요구하지만, 기존 검색 엔진은 읽기 전용 스냅샷 기반이라 데이터 지연이 발생한다.
lakebase_vector는 RaBitQ를 활용해 벡터 인덱스 크기를 32배 압축하며, 1억 개의 벡터를 192GB 인스턴스에서 처리한다.
근거
  • RaBitQ를 통해 인덱스 크기를 32배 압축한다. lakebase_vector: 32x compression and 1B+ scale. 섹션
lakebase_text는 GIN 인덱스 없이도 BM25 랭킹을 지원하여 메모리 오버헤드 없이 풀텍스트 검색을 수행한다.
계층형 스토리지 아키텍처는 활성 데이터만 RAM/NVMe에 유지하고 나머지는 저비용 객체 스토리지에 저장하여 비용을 획기적으로 절감한다.
단일 SQL 쿼리 내에서 벡터 유사도와 키워드 관련성을 결합한 하이브리드 검색이 가능하여 에이전트의 컨텍스트 관리 효율을 높인다.
근거
  • LAION-100M 벤치마크에서 0.95 Recall@10을 달성했다. Postgres is ready for large-scale, serious search workloads 섹션의 표

용어 해설

RaBitQ
Randomized Binary Quantization의 약자로, 벡터를 이진화하여 압축하는 기법입니다. 데이터의 정밀도를 유지하면서 인덱스 크기를 획기적으로 줄여 메모리 사용량을 최적화하고 대규모 벡터 검색을 가능하게 합니다.
BM25
정보 검색에서 문서의 관련성을 평가하는 알고리즘입니다. TF-IDF를 개선하여 문서 길이와 용어 빈도를 고려한 점수를 산출하며, 풀텍스트 검색의 표준적인 랭킹 지표로 사용됩니다.
계층형 스토리지(Tiered Storage)
데이터의 접근 빈도에 따라 저장 매체를 다르게 배치하는 구조입니다. 자주 사용하는 데이터는 고성능의 RAM이나 NVMe에, 드물게 사용하는 데이터는 저비용의 객체 스토리지에 저장하여 성능과 비용 효율을 동시에 달성합니다.
하이브리드 검색(Hybrid Search)
벡터 유사도 검색과 키워드 기반의 풀텍스트 검색을 결합한 방식입니다. 두 검색 결과를 상호 보완적으로 활용하여 검색 정확도를 높이고, 의미론적 맥락과 정확한 용어 매칭을 동시에 만족시킵니다.

기술

  • PostgreSQL
  • lakebase_vector
  • lakebase_text
  • RaBitQ
  • BM25

활용 사례

  • RAG 시스템
  • 에이전트 메모리 관리
  • 대규모 하이브리드 검색
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 16.수집 2026. 06. 16.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.