TL;DR
공개된 논문을 재현하는 수준을 넘어, 에이전트가 자체적으로 경쟁력 있는 연구 방법을 찾아 SOTA를 초과할 수 있는지를 대규모로 측정하는 첫 벤치마크이다. 과제 패키지의 컨테이너화와 정보 방화벽, SOTA 정규화 지표를 결합하여 재현성·공정성·발견 가능성을 동시에 확보한다.
왜 중요한가
공개된 논문을 재현하는 수준을 넘어, 에이전트가 자체적으로 경쟁력 있는 연구 방법을 찾아 SOTA를 초과할 수 있는지를 대규모로 측정하는 첫 벤치마크이다. 과제 패키지의 컨테이너화와 정보 방화벽, SOTA 정규화 지표를 결합하여 재현성·공정성·발견 가능성을 동시에 확보한다.
핵심 기여
NatureGym: 논문→컨테이너화된 과제 패키지 파이프라인
논문을 전처리해 task brief, 공용 입력 데이터(problem/data/), 숨겨진 평가자(evaluation/)와 ground truth, SOTA 앵커를 포함하는 컨테이너화된 패키지로 변환하는 자동화 파이프라인이다. 파이프라인은 Paper Filtering, Dataset Acquisition & Verification, Task Package Construction의 세 단계와 인간 확인이 결합된 verify–repair 루프를 포함한다.
NatureBench: 6개 과학 분야 90개 과제의 발견 지향 벤치마크
2022–2025년 Nature-family 논문에서 추출한 90개 과제를 수록하고, 각 과제는 다중 인스턴스·이종 메트릭·다양한 입력 모달리티를 포함한다. 평가 목표는 논문 보고 SOTA 대비 SOTA-normalized relative gap g로, 발견(Discovery) 능력을 측정하도록 설계되었다.
정보 방화벽과 재현-모드 보정으로 환경 단편화와 누출 위험 완화
패키지 구성 시 원저자 방법·중간 출력·식별 가능한 파일을 제외하고, reproduce-mode 감사에서 원문을 추가로 노출해 패키지 정합성과 SOTA 앵커 보정 여부를 검사한다. 이 방식으로 빌드 시와 평가 시 발생하는 누수·정의 오류를 발견·수정했다.
발표된 SOTA 대비 정규화 지표와 사후 유효성 검사
인스턴스별로 dir_i·(m_i - m_i^{sota})/|m_i^{sota}| 형태의 상대 격차 g_i를 사용해 메트릭 이질성을 제거하고, 제출물에 대해 post-hoc judge(출력 위조·피드백 게임 등)를 적용해 단순 점수 게임을 필터링한다.
대규모 에이전트 평가와 거버넌스 결과 공개
Claude Code, Codex CLI, Gemini CLI 기반의 10개 모델을 동일한 예산·웹검색 금지 조건으로 평가해 Claude Opus 4.7이 17.8% 과제에서 SOTA 초과, 47.8%에서 SOTA 매칭이라는 실험 결과를 제공하고 코드·리더보드를 공개했다.
핵심 아이디어 이해하기
기존 한계: 논문 기반 평가나 Kaggle형 최적화 벤치마크는 '재현' 또는 '엔지니어링 최적화'에 집중해 에이전트가 실제 과학적 발견(Discovery) 능력을 갖추었는지 판단하기 어렵다. 종종 데이터·환경이 흩어져 있어 동일한 실험을 독립적으로 재실행하기 어렵고, 원저자 방법이 패키지에 남아 있으면 단순 재현이 가능하다. 이로 인해 에이전트가 논문 SOTA를 넘어서는 능력을 정당하게 검증하기 힘들다.
해결 원리: NatureBench는 논문을 자동으로 컨테이너형 과제 패키지로 변환하는 NatureGym을 중심으로 문제를 재구성한다. 각 패키지는 에이전트에게 입력 데이터와 태스크 브리프만 제공하고 원저자 방법은 숨긴다(정보 방화벽). 평가 시에는 SOTA-normalized relative gap g를 단일 비교 척도로 사용한다. g은 [주요 메트릭 m_i, 논문보고 SOTA m_i^{sota}, 방향 dir_i]을 입력으로 받아 dir_i·(m_i - m_i^{sota})/|m_i^{sota}|를 계산해 과제 간 비교가 가능한 스칼라 값으로 만든다. 이 값의 의미는 '논문 SOTA 대비 상대적 성능 이득/손실'이다.
달라지는 점: 정보 방화벽과 재현-모드 감사로 '재현 가능한 환경'을 만들면서 에이전트가 논문 방법을 그대로 사용하는 것을 방지해 '발견' 능력을 노출한다. 또한 g로 정규화해 서로 다른 메트릭(AUROC, RMSE, Spearman 등)을 한 축으로 비교하므로 대규모·이질적 과제 집합에서 모델 간 상대 성능을 일관되게 평가한다. 실험에서는 에이전트가 실제로는 많은 경우에 기존 논문 방법과 동일한 방법군을 택하지 않고 supervised proxy/prediction으로 환원하는 방식(method translation)으로 성공하는 경향이 확인되었다.
방법론
전체 접근 방식과 핵심 아이디어: NatureGym 파이프라인이 원문을 받아 세 단계(1. Paper Filtering, 2. Dataset Acquisition & Verification, 3. Task Package Construction)로 처리해 각 과제를 T=(A,D,M,S,B) 형태의 구조화된 레코드로 만든다. 파이프라인 각 단계는 LLM 기반 자동화와 인간 검토의 verify–repair 루프를 갖추며, 최종적으로 문제 정의(problem/), 에이전트-가시 데이터(problem/data/)와 숨겨진 평가자(evaluation/)를 포함한 Docker 기반 패키지를 생성한다.
핵심 메커니즘 상세: 필터링 단계는 세 수준(추출 가능성, 자동화 가능한 평가, 데이터 완전성)으로 논문을 선별한다. 획득 단계에서는 파일-레벨 방화벽을 적용해 '해당 파일이 어떤 방법을 쓰더라도 문제 정의를 위해 반드시 필요한가?'를 기준으로 보존 여부를 결정한다. 불필요한 저차원 구현·중간 출력은 제거한다. 패키지 구성 단계에서는 problem/README.md(태스크 정의)와 problem/data_description.md(데이터 스키마), evaluator.py(결정적 채점 함수), evaluation/ground_truth(숨겨진 정답)을 조합해 실행 가능하고 일관된 인터페이스를 만든다.
평가 프로토콜과 점수화: 에이전트는 격리된 Docker 컨테이너에서 문제를 해결하며 4시간 wall-clock 예산과 메타데이터에 기록된 GPU를 할당받는다. 에이전트는 /evaluate, /best_score, /time_remaining 세 엔드포인트로 호스트 평가 서비스와 상호작용한다. 인스턴스별 상대 격차 g_i는 다음 계산을 거친다: 입력값으로 에이전트 점수 m_i와 논문 SOTA m_i^{sota}, 방향 dir_i를 받아 (m_i - m_i^{sota})/|m_i^{sota}|를 구하고, 여기에 dir_i를 곱해 g_i를 얻는다 → 이 값은 'SOTA 대비 상대적 이득'을 표현한다. 태스크 점수는 인스턴스 평균이고 제출이 유효하지 않으면 g_i^{fail}=-1.0이 할당된다.
품질 보정 및 재현 감사: 평가 전 reproduce-mode에서 Claude Opus 4.6과 DeepSeek-V4-Pro를 사용해 패키지의 정합성과 SOTA 앵커를 감사했다. reproduce-mode에서는 원문과 방법이 에이전트에 제공되어 패키지가 논문 방법을 실험적으로 지원하는지 검사한다. 이 과정에서 문제·데이터·평가자 불일치가 발견되면 수리하거나 과제를 제거해 최종 90개 과제를 확정했다.
관련 Figure

이 다이어그램은 파이프라인 각 단계에서 수행되는 산출물과 독립 리뷰의 역할을 명확히 제시한다. 정보 방화벽과 verify–repair 루프가 패키지 정합성과 누수 방지에 어떻게 기여하는지 연결된 흐름으로 확인된다.
NatureGym 파이프라인 다이어그램으로 Paper Filtering, Dataset Acquisition & Verification, Task Package Construction의 흐름과 검토(Review) 루프를 보여 준다.

이 그림은 reproduce-mode가 패키지 결함(예: evaluator 오류, 데이터 누수)과 에이전트 한계(리소스·능력)를 분리해 진단하는 절차를 보여 준다. 재현 성공률(Claude Opus 4.6:30/90, DeepSeek:21/90)과 재현 성공 시 g의 근소 편차로 SOTA 앵커 신뢰성을 확인한 근거를 시각적으로 제공한다.
reproduce-mode 보정 흐름과 재현 감사를 통해 패키지 결함의 원인을 판별하는 과정, 그리고 Claude Opus 4.6과 DeepSeek-V4-Pro의 재현 성과를 요약한다.

이 도식은 에이전트가 격리된 컨테이너에서 작업하고 평가 서비스는 숨겨진 ground truth·SOTA 앵커를 호스트에서 유지하는 구조를 보여 주어 정보 방화벽과 평가 신뢰성의 구현 세부를 보강한다. /evaluate, /best_score, /time_remaining API 제약이 명시되어 있다.
평가 프로토콜 전경(Agent Container, Eval Service, Host Backend)과 agent-호스트 상호작용, 제출·스코어링·사후 심사 흐름을 한 페이지로 요약한다.
주요 결과
메인 벤치마크 결과: 최종 코퍼스는 90개 과제(333 인스턴스)이며, Claude Opus 4.7이 가장 높은 성과를 보였다. Claude Opus 4.7은 Surpass-SOTA(g>0.1)에서 17.8%의 과제, Match-SOTA(g≥0)에서 47.8%를 기록했다. 뒤이어 Gemini 3.5 Flash(15.6% / 37.8%)와 GPT-5.5(14.4% / 44.4%)가 있다. 전반적으로 명확한 SOTA 초과는 드물고 Match-SOTA도 과제의 절반 미만에 머문다.
재현성 및 보정 결과: reproduce-mode에서 Claude Opus 4.6은 90개 중 30개 과제를 성공적으로 재현(g≥-0.05)했고, DeepSeek-V4-Pro는 21개를 재현했다. 재현이 성공한 과제들에서 g 편차는 작게 군집해 SOTA 앵커 보정이 신뢰할 만한 수준임을 확인했다(재현 성공 과제 16개에서 median deviation ≈ -0.0026, 90% 편차 ≤ 0.031).
성공·실패 메커니즘: 성공 사례의 45.5%가 supervised proxy prediction(일반적 ML 엔지니어링)으로 나타났고, 최종 성공의 상당 부분(약 82.7%)이 엔지니어링적 개선·튜닝·파이프라인 확장에 기인했다. 실패 원인은 주로 잘못된 방법 선택(총 실패의 45.1%)과 계산 자원 부족(24.4%)이었고, 태스크 오해는 소수(3.1%)에 불과했다. 점수 분포는 대부분 SOTA보다 다소 낮은 범위에 집중되며, 일부 극단적 음수 값은 SOTA 정규화 특성에서 기인한다.
관련 Figure

이 그림은 벤치마크가 여섯 도메인(예: Cellular Omics, Protein Biology 등)을 포함하고, 에이전트별 Surpass-SOTA 분포가 제한적임을 시각적으로 보여 준다. 결과적으로 전 범위에서 SOTA 초과가 희귀하다는 논문의 주장을 직관적으로 보강한다.
NatureBench 개요 그림으로 6개 과학 도메인, 태스크 수, 그리고 상위 에이전트의 Surpass-SOTA 비율을 요약한다.

이 차트는 과제 분포(저널 출처, 도메인별 과제 수, 입력 모달리티, 데이터 크기 범위 등)를 한눈에 보여 주어 벤치마크의 폭(breadth)과 이질성(heterogeneity)을 정량적으로 뒷받침한다. 평가 지표 이질성으로 인한 정규화 필요성을 시각적으로 뒷받침한다.
NatureBench 코퍼스 구성 차트로 90개 과제가 도메인·태스크 타입·데이터 특성에 걸쳐 어떻게 분포하는지 요약한다.

이 그래프는 대부분 과제에서 에이전트 성능이 SOTA에 미달하며, 소수의 과제에서만 SOTA를 초과한다는 점을 보여 준다. 음의 꼬리가 존재함을 통해 SOTA 정규화의 극단치 발생을 확인할 수 있다.
에이전트별 g 분포 막대 그래프로 상대 격차 구간별(예: g>0.5, 0.2–0.5, …, g<-0.5) 과제 비율을 시각화한다.

이 그림은 Match-SOTA 성공의 45.5%가 supervised proxy prediction에 의해 발생했고, 실패의 61.1%가 방법 계층에 집중됐다는 정량적 분해를 제공한다. 논문의 주요 결론(성공은 발견보다 방법론 번역에 의존, 실패는 방법 선택·자원 제약에 기인)을 뒷받침한다.
해결 메커니즘 분석(성공모드와 실패층) 차트로, 성공은 주로 proxy prediction·튜닝·엔지니어링 파이프라인에 기인하고 실패는 방법 선택·실행 부족에 집중됨을 보여 준다.

이 그림은 도메인별 성능 서열(예: Relational이 상대적으로 쉬움, Biomedical/Molecular이 어려움)과 75개 단일-분야 대비 15개 교차-분야 과제에서 median g_all이 더 낮아지는 현상을 시각적으로 제시해 도메인·교차성 영향의 일관성을 확인한다.
도메인별 Match-SOTA 비율과 median g_all을 도식화한 그래프로, 여섯 도메인에 걸친 난이도 그라디언트와 교차-학문 과제의 난이도 증가를 보인다.
기술 상세
전체 아키텍처 구조: 각 과제는 T=(A,D,M,S,B) 구조로 표현되며, 문제 정의와 데이터(problem/), 숨겨진 평가자(evaluation/)를 분리한 컨테이너로 배포된다. 파이프라인 단계마다 자동화 에이전트(LLM)와 인간 리뷰를 결합해 레코드를 누적·보정한다. 빌드 타임에는 36개 자동 점검 항목과 end-to-end 베이스라인 실행이 포함된다.
핵심 메커니즘의 알고리즘적 기반: 필터링은 (i) task extractability, (ii) evaluation automatability, (iii) data completeness 세 축으로 작동한다. 데이터 획득 단계에서는 Tier S/M/L 분류를 통해 다운로드 정책을 달리하고, 파일-레벨 방화벽 규칙으로 원저자 알고리즘 A가 생성하는 파일을 제외한다. 평가자는 Label/Oracle/Distribution 세 유형을 지원하며, evaluator.py는 입력 포맷 검증→스코어 계산→인스턴스별 실패 격리 순으로 동작한다.
Prior work 대비 차별점: 기존 PaperBench 계열은 재현·검토에 집중하거나 Kaggle형 최적화에 치우쳤다. NatureBench는 논문 소스→컨테이너화→SOTA 정규화 점수화→post-hoc validity judge의 결합으로 'Discovery' 측정을 목표로 삼아 서로 다른 메트릭과 모달리티를 단일 비교 축으로 통합한다.
구현 및 실행 세부사항: 평가 시 에이전트는 4시간 wall-clock 예산과 과제별 메타데이터에 기록된 GPU를 받는다(대부분 RTX 3090/4090, 최상급은 A800). 에이전트-호스트 상호작용은 세 엔드포인트(/evaluate, /best_score, /time_remaining)로 제한되고, 웹 검색은 금지된다. 제출물에 대해 Claude Sonnet 4.6 기반의 post-hoc judge가 출력 위조 등 비정상 행위를 필터링한다.
한계점
논문에 명시된 한계만 기술한다. (1) 각 과제는 원저자 논문의 '코어' 정량적 문제의 일부 방향만 평가할 수 있으며, 일부 논문 기여의 다목적성은 과제 스냅샷으로 온전히 포착되지 않을 수 있다. (2) SOTA 정규화 g는 분모에 있는 SOTA 값에 민감해 극단적 g 값이 발생할 수 있으며, 이런 극단치는 설계의 산물로 남는다. (3) 공개 데이터·입력의 특성상 잔존 가능한 누수·피드백 위험이 존재하나 프로토콜과 사후 심사로 대부분 제어되었다. (4) 평가 예산(균등한 wall-clock·리소스)이 제한 요인으로 작동해 일부 재현 실패는 패키지 결함이 아니라 리소스 제약에 기인한다.
실무 활용
NatureBench와 NatureGym는 논문 기반 과제를 자동으로 패키징하고 표준화된 평가를 제공하므로, 연구·제품 검증용 평가 파이프라인 또는 학습 데이터로 활용 가능하다. 공개 GitHub 저장소로 재현 가능한 작업 흐름을 제공해 벤치마크 확장과 유지관리에 실무적 기반을 제공한다.
- 연구 기관이 내부 에이전트의 과학적 문제 해결 능력을 논문 SOTA 기준으로 객관적 비교·검증하는 용도
- AI-for-Science 에이전트 개발자가 도메인별 과제 집합에서 방법 선택·파이프라인 효과를 검증하는 실험 스위트
- 교육·평가 목적으로 논문→실행 가능한 과제 패키지를 생성해 연구 재현성 훈련에 활용
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- SOTA-normalized relative gap
- — 각 과제의 주된 평가 지표 m_i와 논문이 보고한 SOTA m_i^{sota}를 기준으로 방향(dir_i)을 곱해 (m_i - m_i^{sota})/|m_i^{sota}|를 계산한 값이다. 이 값은 지표의 크기와 방향성을 정규화하여 서로 다른 메트릭 간 비교를 가능하게 한다. g_i ≥ 0이면 해당 인스턴스에서 에이전트가 논문 SOTA를 맞추거나 초과한 것이다.
- Information Firewall
- — 과제 패키지에서 원저자 방법(코드·중간 결과·메서드 구현)을 숨기고 입력 데이터·태스크 브리프·평가자만 에이전트에게 노출하는 조치이다. 이로써 에이전트가 단순 재현이 아니라 문제 해결(Discovery) 경로를 찾아야 하며, 평가 시 소스 방법의 직접적 재사용을 차단한다.
- Reproduce Mode
- — 과제 패키지에 원문과 원저자 방법을 추가로 노출해 에이전트가 논문에 보고된 절차를 충실히 재현하도록 하는 실행 모드이다. 이 모드는 패키지의 정합성(데이터·평가자·메타데이터)과 SOTA 앵커의 보정 여부를 검사하는 데 사용된다.
- Method Translation
- — 에이전트가 과학적 문제를 도메인 특화 방법 대신 표준화된 supervised-prediction 유형의 ML 파이프라인으로 환원해 해결하는 경로이다. NatureBench 실험에서 성공의 주요 비중(약 45.5%)을 차지한 메커니즘으로 확인되었다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.