왜 중요한가
기존 AI 벤치마크는 정답이나 연구 절차가 미리 정해진 과제를 중심으로 모델의 지식과 실행 능력을 측정하는 경우가 많았습니다. ASI-Bench는 동일한 연구 목표와 데이터를 유지한 채 방법론적 지침을 B1부터 B4까지 줄여, AI가 방법 선택부터 실행과 검증까지 독립적으로 이어 갈 수 있는지를 직접 측정합니다. 18개 Agent × Model 구성의 평균 B3 점수가 26.62에 그쳐 현재 시스템의 과학적 자율성이 아직 제한적이라는 기준선을 제공합니다.
핵심 기여
방법론적 지침을 줄이는 연구 자율성 평가
ASI-Bench는 같은 과제를 B1부터 B4까지 다른 지침 수준으로 제공해 절차 실행, 방법 구현, 독립적 연구 수행을 구분합니다. B1은 전체 방법과 절차를 제공하고, B2는 방법만 지정하며, B3는 연구 목표와 데이터만 제공하고, B4는 여기에 무관한 정보를 추가합니다. 이 구조로 사람의 절차 설계가 사라질 때 AI 성능이 얼마나 유지되는지 측정합니다.
11개 과학 분야의 프로젝트 수준 과제
벤치마크는 수학, 물리학, 화학, 생물학, 천문학, 재료과학, 지구과학, 의학 및 생물통계학, 컴퓨터과학, 로보틱스, 전기공학에 걸친 60개 연구 과제를 포함합니다. 각 과제는 과학적 목표, 과제별 데이터, 실행 환경, 검증 가능한 연구 산출물로 구성됩니다. 따라서 한 분야의 익숙한 작업이 아니라 서로 다른 데이터와 검증 기준으로의 일반화를 평가합니다.
전문가 검토와 실행 검증을 결합한 구축 과정
1,300개 이상의 연구 아이디어를 과학 자료에서 수집한 뒤 5차례 검토, 1,100건 이상의 리뷰 배정, 2,000건 이상의 과제 수정 과정을 거쳤습니다. 과학적 논리, 정보 누출, 기준 결과, 채점 코드, 의도하지 않은 지름길을 점검하고, 1,500회 이상의 샌드박스 실행으로 런타임과 산출물 생성을 확인했습니다. 전체 구축에는 31,000시간 이상의 인력이 투입되었습니다.
모델과 하니스의 상호작용 측정
ASI-Bench는 같은 모델을 서로 다른 에이전트 하니스와 결합하거나 같은 하니스에서 모델을 바꾸는 방식으로 시스템 구성을 비교합니다. MiMo V2.5 Pro는 MiMo Code에서 16.17점, Claude Code에서 23.25점을 기록했고, Kimi K2.7은 각각 19.72점과 27.34점을 기록했습니다. 이 차이는 과학적 능력이 백본 모델 하나가 아니라 모델과 실행 시스템의 결합에서 나타날 수 있음을 수치로 확인합니다.
핵심 아이디어 이해하기
기존 AI 연구 평가는 정답이나 절차가 이미 정해진 문제에서 입력을 처리하고 출력을 맞히는 능력을 주로 측정합니다. 이때 모델은 필요한 방법과 실행 순서를 직접 결정하지 않아도 되므로, 지식을 적용하는 능력과 새로운 연구를 설계하는 능력이 분리되지 않습니다. ASI-Bench는 이 한계를 연구 목표, 데이터, 요구 산출물은 유지하면서 사람이 제공하는 방법론적 지침만 줄이는 방식으로 겨냥합니다.
B1에서는 지배 방정식, 수치 정식화, solver 절차처럼 구현에 필요한 세부 지침을 모두 받으므로 에이전트의 입력은 완성된 연구 절차에 가깝습니다. B2에서는 방법의 종류만 남아 에이전트가 그 방법을 실행 가능한 workflow로 변환해야 하고, B3에서는 관측 데이터와 목표만 받아 underlying model, 수치 방법, 구현, 예측 검증을 스스로 결정해야 합니다. B4는 B3에 과제와 무관한 정보를 더해 연구 방향을 유지하는 능력까지 확인합니다.
이 과정에서 평가는 단순한 답변 생성이 아니라 문제 이해, 방법 선택, 구현, 실험, 실패 복구, 반복 개선, 결과 검증을 연결한 장기 실행으로 바뀝니다. 입력은 연구 목표와 과제별 데이터이고, 처리 과정은 방법 결정과 코드 실행 및 결과 해석이며, 출력은 검증 가능한 과학 산출물입니다. 평균 점수가 B1의 50.91에서 B2의 29.10, B3의 26.62로 떨어진 결과는 현재 시스템의 핵심 병목이 방법 이름을 고르는 일보다 방법을 완전한 연구 절차로 operationalize하는 데 있음을 의미합니다.
방법론
ASI-Bench는 60개 프로젝트 수준 연구 과제를 11개 과학 분야에 배치하고, 과제·데이터·필요 출력·채점 기준을 고정한 상태에서 B1부터 B4까지 지침 수준만 변경합니다. 각 과제에서 에이전트는 문제 이해, 방법 선택, 구현, 실험, 실패 진단, 반복 수정, 결과 검증을 거쳐 검증 가능한 연구 산출물을 만들어야 합니다. 전체 과제의 연구 과정은 2,600회 이상의 상호작용과 2,400회 이상의 실행 단계를 포함하며 35시간 이상의 에이전트 실행에 걸쳐 있습니다.
지침 감소는 네 단계로 구현됩니다. B1은 방법과 구현 단계 및 매개변수 선택을 모두 제공하고, B2는 방법의 종류만 알려 주며, B3는 연구 목표와 관측 데이터 및 요구 출력만 제공합니다. B4는 B3 조건에 과제와 무관하지만 그럴듯한 정보를 추가해 방해 상황에서 연구 방향을 유지하는지를 확인합니다.
과제 구축은 과학 자료에서 1,300개 이상의 아이디어를 수집하는 단계로 시작합니다. 이후 5차례 검토와 1,100건 이상의 리뷰 배정, 2,000건 이상의 수정으로 과학적 정식화, 지침 설계, 기준 결과, 채점 기준, 정보 누출 여부를 점검합니다. 마지막으로 격리된 샌드박스에서 기준 해답과 에이전트 실행을 끝까지 돌려 런타임 안정성, 산출물 생성, 재현성, 채점 일관성을 확인하고 문제가 남은 과제는 수정하거나 제외합니다.
관련 Figure

왼쪽에서 scientific sources를 바탕으로 problem collection을 진행하고, 1,300개 이상의 아이디어를 전문가 검토로 넘긴 뒤 2,000건 이상의 수정, 1,100건 이상의 review assignments, 5 review rounds를 거칩니다. 이후 1,500회 이상의 sandbox runs를 거쳐 31,000시간 이상의 인력과 11개 scientific domains를 포함한 ASI-Bench로 정리됩니다. 이 흐름은 후보 수집부터 전문가 검토, 실행 검증, 최종 benchmark 확정까지 이어지는 다단계 품질 관리 절차를 시각적으로 연결합니다.
과학 자료에서 연구 문제를 수집한 뒤 전문가 검토와 반복 수정, sandbox 실행을 거쳐 ASI-Bench 과제로 확정하는 구축 흐름도입니다.
주요 결과
18개 Agent × Model 구성의 60개 과제 평균 점수는 B1에서 50.91, B2에서 29.10, B3에서 26.62, B4에서 26.99였습니다. 상세 절차를 제거하고 방법만 남긴 B2에서 B1보다 21.82점 하락했지만, 방법 자체까지 제거한 B3에서는 B2보다 2.48점만 추가 하락했습니다. 이는 방법 선택보다 지정된 방법을 완전한 실행 절차로 바꾸는 과정이 더 큰 병목임을 의미합니다.
가장 높은 B3 점수는 Codex와 GPT-5.6 Sol (ultra)의 51.60점이었고, 방법을 독립적으로 정해야 하는 조건에서 50점을 넘은 유일한 구성으로 기록되었습니다. GPT-5.6 Sol의 추론 설정을 xhigh에서 ultra로 높이면 B3 점수가 40.86에서 51.60으로 10.74점 상승했습니다. 반면 B4 평균은 B3보다 0.36점 높은 26.99로, 무관한 정보의 추가 영향은 절차 지침의 감소보다 작았습니다.
계산량도 지침 수준에 따라 달라졌습니다. B1은 과제당 평균 4.35M tokens와 37.8분이 필요했지만, B2는 6.91M tokens와 49.7분으로 각각 59%와 32% 늘었고, B3와 B4는 B1보다 토큰 소비가 각각 25%와 30%, 실행 시간이 각각 22%와 18% 증가했습니다. Codex와 GPT-5.6 Sol (xhigh)는 약 $684의 실행 비용으로 B3 40.86%를 기록해 $2,728이 필요한 Claude Opus 5와 Claude Code의 40.70%에 가까웠으며, GPT-5.6 Sol (ultra)는 약 $1,550으로 B3 51.60%를 기록했습니다.
관련 Figure

상단 도식은 Biology, Robotics, Chemistry, Math 등 여러 분야의 프로젝트 과제를 중심에 둔 ASI-Bench 구성을 나타내며, 중앙 원형 그래프는 31,000시간 이상의 human hours와 11개 분야를 함께 표시합니다. 하단 왼쪽 막대그래프에서는 Codex와 GPT-5.6 Sol이 각각 51.6과 40.7의 B3 점수를 기록하고, 하단 오른쪽 선그래프에서는 GPT-5.6 Sol이 B1 71.8에서 B2 49.6, B3 51.6, B4 50.4로 변하는 흐름을 확인할 수 있습니다. 그림은 분야 범위와 지침 감소에 따른 성능 변화를 동시에 연결해 논문의 benchmark 설계와 주요 결과를 뒷받침합니다.
ASI-Bench의 11개 과학 분야와 31,000시간 이상의 인력 투입, 그리고 모델별 B3 및 B1부터 B4까지의 성능 변화를 한 화면에 배치한 개요 그림입니다.

각 모델에서 HLE, SWE, Terminal 점수는 대체로 40% 이상이지만 ASI-Bench B3 점수는 Kimi K3 27.8, Claude Opus 5 40.7, GPT-5.6 Sol 51.6, GLM-5.2 30.3으로 더 낮거나 모델별 차이가 크게 나타납니다. GPT-5.6 Sol은 HLE 45.5와 SWE 64.6, Terminal 88.8에 이어 ASI-Bench B3 51.6을 기록해 일반 지식이나 도구 실행 점수만으로 프로젝트 수준 과학 자율성을 대체하기 어렵다는 비교를 제공합니다. 이 그림은 ASI-Bench가 기존 benchmark와 다른 능력 조합을 측정한다는 결과 해석과 직접 연결됩니다.
Kimi K3, Claude Opus 5, GPT-5.6 Sol, GLM-5.2의 HLE, SWE, Terminal, ASI-Bench B3 점수를 비교한 막대그래프입니다.
기술 상세
ASI-Bench의 핵심 단위는 단일 질문이 아니라 과학적 목표, 과제별 데이터, 실행 환경, 요구 산출물, 채점 기준을 묶은 프로젝트입니다. 에이전트는 입력으로 목표와 데이터를 받고, 방법을 선택하거나 전달받은 방법을 절차로 변환한 뒤 구현과 실험을 수행하며, 중간 결과를 해석해 실패를 수정하고 최종 산출물을 검증합니다. 따라서 점수는 한 번의 정답 생성보다 장기적인 입력·처리·출력 연결을 반영합니다.
B1부터 B4까지의 정보 설계는 동일 과제에 대한 통제된 개입으로 작동합니다. B1에서는 PDE, 수치 formulation, solver procedure가 직접 주어지고, B2에서는 PDE 종류와 적절한 수치 접근만 남으며, B3에서는 시공간 관측 데이터와 과학적 목표 및 출력 요구만 남습니다. B4는 B3에 task-irrelevant information을 추가하므로, 과학적 목표를 유지하면서 방해 정보에 대한 견고성도 점수에 반영됩니다.
평균 진단값은 B2 − B1 = -21.82, B3 − B1 = -24.29, B4 − B3 = +0.36으로 계산됩니다. 여기서 각 차이는 지침 조건별 점수의 차이를 뜻하며, 음수일수록 사람의 지침을 제거했을 때 성능 손실이 크다는 의미이고, B4 − B3가 0에 가까우면 방해 정보보다 절차 정보의 부재가 더 큰 영향을 준다는 의미입니다. 예를 들어 평균 B1 50.91에서 B2 29.10을 빼면 -21.81로 표시되며, 원문 표의 집계값은 -21.82입니다.
구축 과정은 후보 아이디어 수집, 전문가의 과제화, AI-assisted auditing, 네 차례 human cross-review, 기준 해답과 채점 코드 검증, 샌드박스 end-to-end 실행으로 이어집니다. 31,000시간 이상의 인력과 1,500회 이상의 샌드박스 실행을 투입해 과학적 오류, 정보 누출, 불안정한 실행, 의도하지 않은 지름길을 걸러냈습니다. 최종 산출물은 60개 과제와 11개 분야로 고정됩니다.
실험 결과는 모델과 하니스의 상호작용도 수치화합니다. MiMo V2.5 Pro는 MiMo Code에서 16.17점, Claude Code에서 23.25점을 기록했고 Kimi K2.7은 Kimi Code에서 19.72점, Claude Code에서 27.34점을 기록했지만, Kimi K3는 두 하니스에서 36.22점과 37.09점으로 차이가 작았습니다. 이 비교는 백본 모델의 크기나 이름만으로 과학적 연구 능력을 판단하기 어렵고, 추론·실행·조직화를 담당하는 주변 시스템까지 함께 평가해야 함을 뜻합니다.
한계점
논문은 고정된 어떤 benchmark도 미래 AI가 마주할 어렵고 의미 있으며 검증 가능한 문제의 폭을 완전히 대표할 수 없다고 명시합니다. ASI-Bench 역시 단일 연구팀이 모든 과학 분야와 연구 문제를 포괄할 수 없으므로, 새로운 과제와 평가 방법 및 검증 결과를 공동체가 계속 추가해야 한다는 한계를 갖습니다.
실무 활용
ASI-Bench는 새로운 foundation model, reasoning model, research agent, general-purpose agent가 지식 회상이나 정해진 절차 수행을 넘어 독립적인 연구를 얼마나 이어 가는지 비교하는 데 사용할 수 있습니다. 동일한 모델과 하니스 조합을 B1부터 B4까지 실행하면 실패가 지식 부족, 방법 선택, 도구 실행, 결과 해석, 오류 수정, 안정성 중 어디에서 발생하는지 구분할 수 있습니다. GitHub 저장소와 공개 benchmark 웹사이트를 통해 과제 제출과 시스템 비교를 확장할 수 있습니다.
- AI for Science 시스템이 방법론적 지침이 줄어든 상황에서도 연구 프로젝트를 완주하는지 비교하기
- 같은 백본 모델을 서로 다른 Agent Harness와 결합해 실행 시스템의 기여를 측정하기
- 연구 에이전트의 방법 선택, 구현, 결과 검증 단계별 병목을 B1부터 B4의 점수 차이로 진단하기
- 새로운 과학 연구 과제와 검증된 기준 결과를 공개 benchmark에 추가하기
코드 공개 여부: 공개
코드 저장소 보기키워드
용어 해설
- 방법론적 지침(Methodological Guidance)
- — 연구 목표를 해결하기 위해 사용할 방법, 구현 단계, 매개변수 선택 등을 사람이 미리 제공하는 정보입니다. ASI-Bench는 이 지침을 단계적으로 줄여 AI가 절차를 따르는 수준을 넘어 연구 방법을 스스로 구성하는지 측정합니다.
- 프로젝트 수준 연구(Project-level Research)
- — 단일 질문에 답하는 대신 문제 이해, 방법 선택, 구현, 실험, 실패 진단, 반복 개선, 결과 검증을 하나의 장기 작업으로 수행하는 연구 형태입니다. ASI-Bench는 60개 과제를 이 구조로 구성해 전체 연구 수행 능력을 측정합니다.
- 과학적 자율성(Scientific Autonomy)
- — AI가 연구 목표와 데이터를 바탕으로 적절한 방법을 선택하고, 실행 가능한 절차를 만들며, 실험 결과를 해석하고 검증하는 능력입니다. 이 논문에서는 B1에서 B4로 사람의 방법론적 지침을 줄일 때 성능이 얼마나 유지되는지로 측정합니다.
- 에이전트 하니스(Agent Harness)
- — 모델이 추론하고 도구를 사용하며 작업을 실행하고 연구 과정을 조직하도록 둘러싼 실행 시스템입니다. 같은 모델이라도 하니스에 따라 ASI-Bench 점수가 달라지므로 모델 자체와 시스템 설계의 기여를 분리해 살필 필요가 있습니다.
- 샌드박스 실행(Sandbox Execution)
- — 연구 과제와 기준 해답을 격리된 실행 환경에서 처음부터 끝까지 수행해 실행 안정성, 산출물 생성, 기준 결과 재현성, 채점 일관성을 확인하는 절차입니다. ASI-Bench는 개발 과정에서 1,500회 이상의 샌드박스 실행을 진행했습니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.