본문으로 건너뛰기

BeyondSWE: 단일 저장소 버그 수정을 넘어선 코드 에이전트 평가 벤치마크

기존 코드 에이전트 평가는 단일 저장소 내의 단순 버그 수정에 치중되어 실제 소프트웨어 엔지니어링의 복잡성을 반영하지 못했습니다. 이 논문은 여러 저장소를 넘나들거나 전문 지식이 필요한 4가지 고난도 시나리오를 제시하여, 현재 모델들이 검색 결과와 코딩 로직을 통합하는 데 겪는 근본적인 한계를 증명합니다.

용어 해설

소프트웨어 엔지니어링 벤치마크(SWE-bench)
실제 GitHub 이슈를 활용하여 AI 모델의 버그 수정 능력을 평가하는 표준 벤치마크이다. 모델이 코드베이스를 탐색하고 수정안을 제출하면 테스트 통과 여부로 성능을 측정하며, 에이전트의 실무 능력을 검증하는 핵심 지표로 활용된다.
의존성 마이그레이션(Dependency Migration)
소프트웨어가 사용하는 외부 라이브러리를 최신 버전으로 업데이트하고, 그 과정에서 발생하는 API 변경 사항에 맞춰 기존 코드를 수정하는 작업이다. 단순 버그 수정보다 훨씬 넓은 범위의 코드 리팩터링과 시스템 이해도가 요구되는 고난도 작업이다.
교차 저장소 추론(Cross-Repository Reasoning)
하나의 코드 저장소에 국한되지 않고, 외부 라이브러리나 관련 프로젝트 등 여러 저장소의 정보를 동시에 분석하여 문제를 해결하는 능력이다. 실제 개발 환경에서 다른 프로젝트의 구현 사례를 참고하거나 라이브러리 문서를 확인하는 과정과 유사하다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 03. 04.수집 2026. 03. 05.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.