본문으로 건너뛰기

OpenBioRQ: 에이전트를 위한 해결되지 않은 생의학 연구 질문 벤치마크

OpenBioRQ는 에이전트형 모델의 문헌 기반 증거 수집과 인용 충실도를 실제 열린 연구 질문으로 검증하도록 설계된 점에서 중요하다. 기존 벤치마크는 정답키가 있는 문제를 전제로 하므로 모델이 주어진 출처를 반복해 재현하는 방식으로 통과할 수 있지만 OpenBioRQ는 그런 우회 경로를 차단해 진정한 근거검증 능력을 측정한다. 이로 인해 식별자 존재 여부만으로는 놓치기 쉬운 잘못된 인용(wrong-paper citation)과 도구 포기(agentic collapse) 같은 실패 모드를 계량적으로 드러낼 수 있다.

용어 해설

에이전트형 설정(Agentic)
모델이 외부 도구를 호출하여 다중 라운드로 증거를 수집하고 의사결정을 수행하는 운영 방식으로, 질의응답에서 모델이 스스로 검색·수집·인용을 수행하도록 설계된 환경이다. 이 논문에서는 10개의 생의학 API로 도구 호출을 허용하는 평가 하니스가 agentic 설정에 해당한다. agentic 환경은 도구 사용의 유무와 순서가 성능에 직접 영향을 미치므로 도구 의존성 및 도구 포기(agentic collapse)를 측정할 수 있게 한다.
검색 기반 검증(Retrieval-grounded)
모델의 응답을 외부 검색 결과로 재검증하여 질문의 개방성(open status)이나 응답 근거를 판별하는 절차이다. OpenBioRQ에서는 질문이 실제로 열린 문제인지 확인하기 위해 모델이 수집한 후속 증거만으로 재판정하는 Stage-2 검증을 적용했다. 이 방식은 원문 출처의 프레이밍에 따른 확인 편향을 줄이고 실제 문헌 근거의 존재 여부와 적합성을 판별한다.
고정 체크리스트(Frozen checklist)
각 질문마다 한 번 생성한 구체적 채점 기준을 고정하여 모든 심사자가 동일한 항목으로 채점하게 하는 루브릭 방식이다. 항목별 가중치와 판정(1, 0.5, 0)을 사용해 점수를 0~1로 정량화하고, must_mention·must_acknowledge·must_ground·must_avoid 같은 타입을 포함한다. 체크리스트를 고정함으로써 LLM-대-LLM 채점에서의 재현성과 심사자간 상관을 크게 향상시켰다.
잘못된 논문 인용(Wrong-paper citation)
생성된 식별자(PMID 등)는 실제로 존재하지만 인용된 문헌이 응답에서 주장한 내용을 지지하지 않는 사례를 가리킨다. OpenBioRQ의 L2 판정은 존재 여부(L1)와 구별하여 이 오류를 검출했고, 전체 실제 인용 중 약 15.9%가 이런 잘못된 인용으로 판정됐다. 잘못된 논문 인용은 식별자가 해석자에게 신뢰를 주기 때문에 위조보다 더 심각한 오도 가능성을 갖는다.
에이전트 도구 포기 현상(Agentic collapse)
문제가 가장 어려운 구간에서 모델이 외부 도구 호출을 중단하고 파라메트릭 지식으로 응답을 생성하는 현상이다. OpenBioRQ에서 일부 모델은 가장 난도가 높은 질문에서 도구 호출을 거의 하지 않거나 완전히 중단하여 도구 접근의 이득이 사라지는 패턴을 보였다. 에이전트 도구 포기는 도구 기반 증거 수집이 실제로 도움이 되어야 하는 상황에서 오히려 성능 저하를 초래할 수 있음을 시사한다.
오픈-웨이트 모델(Open-weight)
소스 코드나 가중치가 공개되어 연구자가 직접 접근·재현 가능한 모델을 말하며, OpenBioRQ는 공개 가중치 참조 모델 군(예: GLM-5.1, Qwen3.6, DeepSeek-V4)을 난이도 기준으로 사용했다. 이들로 구성한 로스터가 모두 실패한 질문을 core로 정의하여 난이도의 객관적 기준으로 삼았다. 오픈-웨이트 기준은 재현성과 투명성 측면에서 난이도 구분의 근거로 활용됐다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 20.수집 2026. 06. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.