본문으로 건너뛰기

과학 소프트웨어 수정을 평가하는 SWE-bench Science

SWE-bench Science는 119개 과학 코드 작업에서 에이전트의 낮은 첫 시도 성공률과 네 가지 실패 메커니즘을 측정했다

왜 중요한가

과학 소프트웨어는 실험 장비와 연구 분석의 일부로 기능하므로 코드 오류가 프로그램 동작을 넘어 과학적 결론의 근거를 훼손할 수 있습니다. SWE-bench Science는 20개 과학 분야의 119개 작업을 사용해 코딩 에이전트가 저장소 전체의 과학적 맥락과 시스템 통합을 함께 처리하는지 측정합니다. 최고 성능 에이전트의 pass@1도 50% 미만이어서 과학 소프트웨어 수정에는 일반적인 코드 생성 외에 과학 지식과 실패 원인에 대한 평가가 필요합니다.

핵심 기여

과학 소프트웨어 수정 벤치마크 구축

SWE-bench Science는 98개 GitHub 저장소에서 119개 작업을 모아 20개 과학 분야의 저장소 수준 코딩 에이전트 평가를 구성했습니다. 각 작업은 Issue-driven, Expert-exploratory, Engineering-integration의 세 가지 패러다임으로 정리됩니다. 저장소 코드와 과학적 문제 맥락을 함께 요구해 단순한 함수 단위 코드 생성보다 실제 유지보수 상황에 가까운 평가를 수행합니다.

세부 과학 코딩 작업의 난도 측정

최고 성능 에이전트인 Claude Code with Opus-5 (max)도 pass@1 50% 미만을 기록했습니다. pass@1은 첫 번째 해결 시도가 테스트를 통과하는 비율이므로 단일 시도에서 정확한 과학 코드 수정을 완성하는 능력을 측정합니다. 이 결과는 저장소 탐색, 과학적 추론, 실행 검증을 한 번에 요구하는 작업에서 에이전트의 해결 성공률이 낮다는 사실을 수치로 나타냅니다.

반복되는 에이전트 실패 메커니즘 분류

연구는 과학 지식 또는 추상화 부족, 잘못된 탐색 또는 표면적 수정, 불완전한 수정 범위 또는 시스템 통합 실패, 관찰 사례를 넘어 과학 지식을 일반화하지 못하는 실패를 반복 양상으로 구분했습니다. 이 분류는 테스트 실패라는 최종 결과만 세는 대신 코드 수정 과정에서 어느 능력이 부족했는지 추적하는 기준을 제공합니다. 따라서 에이전트의 오류를 지식 문제, 탐색 문제, 통합 문제, 일반화 문제로 나누어 평가할 수 있습니다.

과학 지침의 효과를 짝지은 절제 실험으로 비교

짝지은 절제 실험은 저장소와 실행 가능한 공학 맥락을 유지한 채 명시적 과학 지침만 제거하는 방식으로 진행됐습니다. 잘 근거를 갖춘 정보는 수정 방향을 제한해 평균 성능과 토큰 효율을 높였지만, 문제와 맞지 않는 지침은 앵커링을 유발했습니다. 과학 지식이 모든 상황에서 정확한 수정 성공률을 높이지는 않는다는 결과가 지침의 품질과 문제 적합성을 함께 평가해야 함을 보여줍니다.

핵심 아이디어 이해하기

일반적인 코딩 에이전트 평가는 테스트를 통과한 작업의 비율을 중심으로 보지만, 과학 소프트웨어에서는 코드가 사용하는 과학적 개념과 계산 가정까지 수정 결과의 타당성에 영향을 줍니다. SWE-bench Science는 GitHub 저장소, 실행 환경, 과학적 문제 맥락을 입력으로 제공하고 에이전트가 문제를 탐색한 뒤 코드를 수정하고 테스트를 통과하는지를 측정합니다. 따라서 함수 하나의 문법적 수정만으로는 충분하지 않고 관련 파일 전체의 수정 범위와 시스템 통합까지 맞아야 성공으로 이어집니다. 연구는 실패를 과학 지식 부족, 표면적 탐색, 불완전한 통합, 지식 일반화 실패로 구분해 단순한 성공률 뒤에 있는 원인을 드러냅니다.

방법론

SWE-bench Science는 98개 GitHub 저장소에서 수집한 119개 작업을 20개 과학 분야와 세 가지 작업 패러다임으로 구성합니다. Issue-driven 작업은 이슈 해결 맥락을, Expert-exploratory 작업은 전문가 수준의 탐색을, Engineering-integration 작업은 여러 구성 요소의 통합을 요구하는 구조로 분류됩니다. 에이전트는 저장소의 코드와 실행 가능한 공학 맥락을 사용해 수정안을 만들고, 첫 번째 시도가 테스트를 통과하는 비율인 pass@1로 결과를 평가합니다. 추가로 동일한 저장소와 실행 환경을 유지하면서 명시적 과학 지침만 제거한 짝지은 절제 조건을 비교해 지침이 성능과 토큰 효율에 미치는 변화를 측정합니다.

주요 결과

최고 성능 에이전트인 Claude Code with Opus-5 (max)의 pass@1은 50% 미만이었습니다. 이 수치는 한 번의 첫 시도만으로 과학 소프트웨어 수정 작업을 정확히 완성하는 비율이 절반에도 미치지 못한다는 뜻이며, 저장소 수준 문제의 난도를 나타냅니다. 실패 양상에서는 과학 지식 또는 추상화 부족, 잘못된 탐색이나 표면적 수정, 수정 범위 또는 시스템 통합의 불완전성, 관찰 사례를 넘어선 과학 지식 일반화 실패가 반복됐습니다. 절제 실험에서는 잘 근거를 갖춘 과학 정보가 평균 성능과 토큰 효율을 높였지만, 문제와 맞지 않는 정보는 앵커링을 유발했고 정확한 수정 성공률을 일관되게 높이지 않았습니다.

기술 상세

평가 단위는 개별 코드 조각이 아니라 GitHub 저장소와 실행 환경을 포함하는 저장소 수준 작업입니다. 에이전트는 작업 유형에 따라 이슈 맥락이나 전문가 탐색 맥락, 여러 구성 요소의 통합 맥락을 읽고 저장소를 탐색한 뒤 수정안을 실행 가능한 상태로 만들어야 합니다. 첫 번째 해결 시도가 통과하면 pass@1에 포함되며, 119개 작업과 20개 과학 분야의 결과를 사용해 과학 소프트웨어 공학 능력을 비교합니다. 실패 메커니즘은 과학 지식 또는 추상화 부족, 잘못된 탐색 또는 표면적 수정, 불완전한 수정 범위 또는 시스템 통합, 사례 밖 과학 지식 일반화 실패로 나뉩니다. 절제 실험에서는 저장소와 실행 가능한 공학 맥락을 입력으로 남기고 명시적 과학 지침만 제거해 지침이 에이전트의 탐색과 수정에 미치는 영향을 비교합니다. 잘 정렬된 지침은 수정 공간을 제한해 평균 성능과 토큰 효율을 높이지만, 정렬이 낮은 지침은 앵커링을 만들어 정확한 수정 성공률을 보장하지 않습니다.

실무 활용

SWE-bench Science는 과학 소프트웨어를 수정하는 코딩 에이전트의 성능을 저장소 수준에서 비교하는 평가 세트로 활용할 수 있습니다. 작업이 세 가지 패러다임과 20개 과학 분야로 나뉘어 있어 에이전트가 이슈 해결, 전문가 탐색, 시스템 통합 중 어느 상황에서 취약한지 비교할 수 있습니다. GitHub 저장소와 실행 가능한 공학 맥락을 유지한 절제 조건도 제공하므로 과학 지침의 품질과 토큰 효율을 함께 평가할 수 있습니다.

  • 과학 소프트웨어 수정 에이전트의 첫 시도 성공률을 119개 작업에서 비교할 수 있습니다. 각 작업의 pass@1을 계산해 한 번의 코드 수정만으로 테스트를 통과하는 비율을 측정합니다. 이를 통해 단순 코드 생성 평가보다 실제 저장소 유지보수에 가까운 성능 차이를 확인할 수 있습니다.
  • 에이전트의 실패를 과학 지식 부족, 표면적 탐색, 통합 누락, 지식 일반화 실패로 분류할 수 있습니다. 수정된 파일과 실행 결과를 각 실패 메커니즘에 연결하면 최종 테스트 실패율만으로는 구분하기 어려운 개선 지점을 찾을 수 있습니다. 에이전트 훈련이나 평가 파이프라인에서 실패 유형별 데이터를 별도로 관리하는 기준으로 사용할 수 있습니다.
  • 에이전트에 제공하는 과학 지침의 효과를 짝지은 조건으로 평가할 수 있습니다. 저장소와 실행 환경을 동일하게 유지하고 명시적 과학 지침만 제거한 뒤 평균 성능, 토큰 효율, 정확한 수정 성공률을 비교합니다. 이 방식은 정보량을 늘리는 것만으로 지침 품질을 판단하지 않고 문제 적합성과 앵커링 위험까지 확인하게 합니다.

코드 공개 여부: 공개

코드 저장소 보기

키워드

SWE-bench Science(과학 소프트웨어 벤치마크)과학 소프트웨어 공학코딩 에이전트pass@1실패 메커니즘과학 지식절제 실험

용어 해설

저장소 수준 벤치마크(Repository-level Benchmark)
개별 함수가 아니라 GitHub 저장소 전체의 코드, 의존성, 실행 환경을 함께 사용해 실제 소프트웨어 수정 능력을 평가하는 방식입니다. 문제 해결에 필요한 파일 탐색과 시스템 통합까지 평가 범위에 포함됩니다.
pass@1
모델이 한 번 생성한 첫 번째 해결 시도에서 테스트를 통과할 확률을 나타내는 평가 지표입니다. 여러 번의 후보 생성 없이 단일 시도의 정확한 수정을 측정하므로 에이전트의 초기 해결 능력을 직접 반영합니다.
과학 소프트웨어 공학(Scientific Software Engineering)
과학적 계산과 연구 결과를 뒷받침하는 소프트웨어를 개발하고 유지보수하는 분야입니다. 코드 오류가 프로그램 동작뿐 아니라 과학적 결론의 근거에도 영향을 줄 수 있어 일반 소프트웨어 수정과 다른 지식과 검증이 필요합니다.
절제 연구(Ablation Study)
시스템의 특정 요소를 제거하거나 유지하면서 성능 변화를 비교하는 실험 방식입니다. 이 연구에서는 저장소와 실행 가능한 공학 환경은 유지하고 명시적 과학 지침만 제거해 과학 지식의 효과를 비교했습니다.
앵커링(Anchoring)
초기에 주어진 정보나 가설에 과도하게 의존해 이후 탐색과 수정 방향이 제한되는 현상입니다. 과학 지침이 실제 문제와 맞지 않으면 에이전트가 해당 지침에 고정되어 정확한 코드 수정을 놓칠 수 있습니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 20.수집 2026. 08. 22.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.