본문으로 건너뛰기

PeopleSearchBench: AI 인물 검색 도구 성능 측정을 위한 오픈소스 벤치마크

AI 인물 검색 도구의 객관적 비교를 위해 실시간 웹 검색 기반의 사실 검증 방법론을 적용한 오픈소스 벤치마크 'PeopleSearchBench'가 공개됐다.

실용적 조언

  • 인물 검색 시스템 구축 시 LLM의 추론에만 맡기지 말고 Tavily와 같은 실시간 검색 API를 연동하여 데이터를 교차 검증해야 한다.
  • 채용 업무에는 데이터베이스 기반 도구가 유리하고, 특정 분야 전문가 탐색에는 웹 검색 기반 에이전트가 더 효과적이다.

섹션별 상세

01
기존의 문서 검색 벤치마크(TREC, BEIR)는 관련성 판단이 주관적이지만, 인물 검색은 현재 직장 유무와 같은 객관적 사실 확인이 핵심이다. LLM-as-Judge 방식은 모델 내부의 낡은 지식과 점수 편향성 문제로 인해 인물 정보의 최신성을 평가하기에 부적합함이 확인됐다. 이를 해결하기 위해 검색 결과를 구체적인 체크리스트로 분해하고 실시간 웹 검색(Tavily API)으로 각 항목을 대조하는 '기준 기반 검증' 방식이 도입됐다.
02
평가 시스템은 쿼리를 분석하여 필수 조건을 추출한 뒤, 검색된 인물이 각 조건을 충족하는지 실시간 데이터를 기반으로 판별한다. 예를 들어 '2021년 이후 논문을 발표한 신진 연구자'라는 쿼리에 대해 출판 연도와 논문 저자 이력을 웹에서 직접 확인하여 점수를 산출한다. 이 방식은 인간 전문가의 판단과 0.78의 높은 상관관계를 보였으며, 모델 간 점수 일관성도 0.75 이상으로 나타났다.
03
성능 평가는 정확도(Relevance), 커버리지(Coverage), 활용성(Utility)의 세 가지 차원에서 이루어진다. 단순히 정확한 결과 하나를 찾는 것보다 얼마나 많은 유효한 결과를 찾아내는지, 그리고 연락처 정보 등 실제 업무에 즉시 활용 가능한 데이터를 포함하는지가 종합 점수에 반영된다. 특정 도구가 소수의 안전한 결과만 반환하여 점수를 높이는 것을 방지하기 위해 nDCG@10의 변형 지표를 사용했다.
04
Lessie, Exa, Juicebox, Claude Code를 대상으로 119개의 쿼리를 테스트한 결과, 전문 에이전트인 Lessie가 종합 점수에서 우위를 점했다. 하지만 채용 시나리오에서는 8억 개의 프로필 데이터를 보유한 Juicebox가 커버리지 면에서 우수했으며, 특정 인물을 찾는 연구 과제에서는 웹 검색 능력이 뛰어난 Claude Code가 전문 도구에 근접한 정확도를 기록했다. 이는 사용 목적에 따라 최적의 도구가 다를 수 있음을 시사한다.

용어 해설

판사로서의 LLM(LLM-as-Judge)
하나의 LLM이 다른 AI 모델의 응답 품질을 평가하는 방식이다. 사람이 직접 평가하는 비용을 줄일 수 있으나, 평가 모델 자체의 편향성이나 훈련 데이터의 한계로 인해 최신 정보 검증에는 취약할 수 있다.
정규화된 할인 누적 이득(nDCG)
검색 알고리즘의 순위 지정 품질을 측정하는 지표이다. 관련성이 높은 결과가 상단에 위치할수록 높은 점수를 부여하며, 검색 시스템의 정확도를 평가하는 표준적인 벤치마크 수단으로 활용된다.
코헨의 카파 계수(Cohen's Kappa)
두 평가자 사이의 일치도를 측정하는 통계적 지표이다. 우연히 일치할 확률을 제외하고 계산하며, AI 모델의 평가 결과가 인간 전문가의 판단과 얼마나 일관성이 있는지 검증하는 데 사용된다.
기준 기반 검증(Criteria-Grounded Verification)
주관적인 품질 평가 대신 검색 결과를 구체적인 사실 항목으로 분해하여 검증하는 방법론이다. 실시간 웹 검색을 통해 각 항목의 진위 여부를 개별적으로 확인하여 평가의 객관성을 확보한다.

언급된 도구

Lessie추천

AI 인물 검색 에이전트

Exa중립

구조화된 엔티티 검색 API

Juicebox추천

AI 기반 채용 플랫폼

Claude Code중립

웹 검색 기능이 포함된 코딩 에이전트

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 04. 07.수집 2026. 04. 07.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.