본문으로 건너뛰기

과학 에이전트의 종단간 워크플로 완수 평가

97개 과학 워크플로에서 최고 완수율은 20.6%에 그쳐 부분 점수와 완료 주장의 한계를 확인했다.

용어 해설

에이전트 스캐폴드(Agent Scaffold)
언어 모델이 도구 호출, 코드 실행, 파일 수정, 단계별 계획을 수행하도록 감싸는 실행 구조입니다. 같은 모델이라도 스캐폴드가 달라지면 작업 분해와 결과물 검증 방식이 달라져 과학 워크플로 완수율에 영향을 줍니다.
과학 워크플로(Scientific Workflow)
고정된 입력에서 데이터 처리, 분석 또는 시뮬레이션, 품질 검증을 거쳐 보고서·표·그림·코드 같은 결과물을 완성하는 다단계 절차입니다. 한 단계의 오류가 뒤 단계와 최종 산출물의 일관성에 영향을 줍니다.
산출물 계약(Deliverable Contract)
과학 과제가 요구하는 파일, 수치, 형식, 그림, 실행 가능한 코드와 상호 일관성 조건을 명시한 평가 기준입니다. 제출물이 일부만 완성되면 높은 부분 점수를 받아도 전체 완수로 인정되지 않습니다.
완수율(Pass Rate)
전체 요구 조건을 충족한 과제의 비율입니다. 이 연구에서는 97개 과제 각각의 점수가 99.9 이상일 때만 완수로 세므로, 부분적으로 잘 수행한 제출물은 완수율에 포함되지 않습니다.
평균 점수(Avg. Score)
과제별 Grader 점수를 전체 과제에 대해 평균 낸 값으로, 산출물의 부분적 진척을 나타냅니다. 과제마다 평가 기준이 달라 과제 간 절대적 성능 척도로 보정된 값은 아니며, 높은 평균 점수가 전체 완수를 보장하지 않습니다.
계약 위반(Contract Breach)
요구된 파일이나 수치가 빠지거나 형식, 실행 결과, 산출물 간 일관성 조건을 충족하지 못한 상태입니다. FrontierChallenge는 Judge 판정과 결정론적 Grader 진단으로 이런 누락을 기록하지만, 하나의 실행에 여러 위반이 함께 나타날 수 있습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 25.수집 2026. 08. 28.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.