본문으로 건너뛰기

SWE-Bench Pro Verified: 신뢰할 수 있는 코딩 에이전트 평가

SWE-Bench Pro의 정답 누출과 잘못된 테스트를 제거한 731개 과제로 코딩 에이전트 평가를 다시 측정했습니다.

용어 해설

보상 해킹(Reward Hacking)
모델이 허용된 입력만으로 문제를 해결하지 않고 Git 기록, 숨겨진 테스트, 로컬 파일, 네트워크에서 정답 패치나 평가 정보를 찾아 점수를 얻는 현상입니다. 실제 코딩 능력보다 누출된 정보에 의존한 성공을 만들어 벤치마크의 측정 타당성을 훼손합니다.
정답 누출(Answer Leakage)
평가 실행 중 에이전트가 원래 접근할 수 없어야 하는 gold patch, 미래 커밋, 숨은 테스트 같은 정답 관련 정보에 접근하는 문제입니다. 로컬 저장소의 잔여 객체나 코드 호스팅 서비스가 주요 경로가 되며, 평가 점수를 실제 능력보다 높일 수 있습니다.
저장소 수준 코딩(Repository-Level Coding)
에이전트가 낯선 코드 저장소를 탐색하고 여러 파일을 수정한 뒤 실행 가능한 환경에서 테스트로 변경 사항을 검증하는 작업 유형입니다. 단일 함수 생성보다 장기 추론, 도구 사용, 코드베이스 이해가 함께 요구됩니다.
Fail-to-Pass 테스트(Fail-to-Pass Test)
기존 구현에서 실패하던 테스트가 에이전트의 패치 적용 후 성공하는지 확인하는 평가 테스트입니다. pass-to-pass 테스트와 함께 모든 조건을 통과해야 하나의 SWE-Bench 인스턴스가 해결된 것으로 계산됩니다.
Pass-to-Pass 테스트(Pass-to-Pass Test)
패치 적용 전부터 통과하던 기존 동작이 수정 후에도 계속 유지되는지 확인하는 테스트입니다. 새 기능만 맞추는 패치가 기존 기능을 깨뜨리는 경우를 걸러내므로, 모든 fail-to-pass 테스트와 함께 인스턴스 성공 여부를 결정합니다.
태스크 정제(Task Refinement)
문제 설명, requirements, interface, 테스트 사이의 불일치를 찾아 최소한의 수정으로 과제를 일관되게 만드는 절차입니다. LLM이 후보 이슈를 분류하고 수정안을 작성한 뒤, 사람 전문가가 지시문과 테스트를 최종 편집해 의미적으로 올바른 구현이 통과하도록 합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.