본문으로 건너뛰기

NatureBench: 코딩 에이전트가 Nature 계열 논문의 공개된 SOTA를 넘어설 수 있는가?

공개된 논문을 재현하는 수준을 넘어, 에이전트가 자체적으로 경쟁력 있는 연구 방법을 찾아 SOTA를 초과할 수 있는지를 대규모로 측정하는 첫 벤치마크이다. 과제 패키지의 컨테이너화와 정보 방화벽, SOTA 정규화 지표를 결합하여 재현성·공정성·발견 가능성을 동시에 확보한다.

용어 해설

SOTA 정규화 상대 격차(SOTA-normalized relative gap)
각 과제의 주된 평가 지표 m_i와 논문이 보고한 SOTA m_i^{sota}를 기준으로 방향(dir_i)을 곱해 (m_i - m_i^{sota})/|m_i^{sota}|를 계산한 값이다. 이 값은 지표의 크기와 방향성을 정규화하여 서로 다른 메트릭 간 비교를 가능하게 한다. g_i ≥ 0이면 해당 인스턴스에서 에이전트가 논문 SOTA를 맞추거나 초과한 것이다.
정보 방화벽(Information Firewall)
과제 패키지에서 원저자 방법(코드·중간 결과·메서드 구현)을 숨기고 입력 데이터·태스크 브리프·평가자만 에이전트에게 노출하는 조치이다. 이로써 에이전트가 단순 재현이 아니라 문제 해결(Discovery) 경로를 찾아야 하며, 평가 시 소스 방법의 직접적 재사용을 차단한다.
reproduce-mode(재현 모드)(Reproduce Mode)
과제 패키지에 원문과 원저자 방법을 추가로 노출해 에이전트가 논문에 보고된 절차를 충실히 재현하도록 하는 실행 모드이다. 이 모드는 패키지의 정합성(데이터·평가자·메타데이터)과 SOTA 앵커의 보정 여부를 검사하는 데 사용된다.
method translation(방법론 번역)(Method Translation)
에이전트가 과학적 문제를 도메인 특화 방법 대신 표준화된 supervised-prediction 유형의 ML 파이프라인으로 환원해 해결하는 경로이다. NatureBench 실험에서 성공의 주요 비중(약 45.5%)을 차지한 메커니즘으로 확인되었다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 23.수집 2026. 06. 25.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.