TL;DR
작성자는 공식 mini-swe-agent Bash-Only 스캐폴드와 SWE-bench Docker harness를 이용해 Ox alpha를 50개 작업에 평가한 결과 48개 해결, 96.0%를 얻었습니다. 하지만 평가는 Django와 Sphinx에 한정된 mini-50 집합에서 이뤄졌고, 두 저장소가 학습 데이터에 포함됐을 가능성, 50개뿐인 표본, 2019~2022년 작업, 무료 모델 엔드포인트와 같은 오염 및 비교 한계가 있습니다. 전체 500개 작업과 12개 저장소를 대상으로 한 다른 Bash-Only 결과가 약 72~77%인 점을 고려하면, 96%는 Fable 5를 능가하는 확정적 순위가 아니라 Ox alpha의 성능 상한선으로 해석해야 합니다. 그럼에도 모든 작업에서 실제 패치를 제출하고 50개 중 48개를 통과시킨 결과는 에이전트형 코딩 능력이 매우 강할 가능성을 뒷받침합니다.
섹션별 상세
용어 해설
- SWE-bench
- — 실제 소프트웨어 저장소의 이슈와 수정 PR을 바탕으로 코딩 에이전트가 버그를 고치는 능력을 평가하는 벤치마크입니다. 에이전트가 패치를 제출한 뒤 저장소별 테스트를 실행해 모든 FAIL_TO_PASS와 PASS_TO_PASS 조건을 통과한 작업만 해결된 것으로 계산합니다.
- 에이전트 스캐폴드(Agent Scaffold)
- — 모델이 코딩 작업을 수행할 때 사용할 도구 호출 형식, 프롬프트, 실행 절차와 단계 제한을 묶은 실행 틀입니다. 같은 스캐폴드를 적용하면 모델 자체의 차이를 비교하기 쉬워지지만, 제작사가 별도로 튜닝한 스캐폴드와는 점수를 직접 비교하기 어렵습니다.
- 데이터 오염(Contamination)
- — 평가에 사용되는 문제나 해결 과정이 모델의 학습 데이터에 이미 포함되어 성능이 실제 일반화 능력보다 높아지는 현상입니다. 이 글에서는 2019~2022년의 Django와 Sphinx 작업이 학습 데이터에 들어갔을 가능성이 SWE-bench 점수를 부풀릴 수 있는 요인으로 거론됩니다.
- FAIL_TO_PASS 테스트(FAIL_TO_PASS)
- — 원래 실패하던 테스트가 제출된 패치 적용 후 통과해야 한다는 SWE-bench 평가 조건입니다. 이 조건만이 아니라 기존에 통과하던 PASS_TO_PASS 테스트까지 모두 통과해야 작업이 해결된 것으로 집계되므로, 패치가 일부 기능만 고친 경우에는 성공으로 계산되지 않습니다.
언급된 도구
SWE-bench 작업에서 Bash 명령을 실행하고 모델의 패치 제출 절차를 관리하는 공식 에이전트 스캐폴드입니다.
Ox alpha를 실행 환경에 연결하고 Go gateway를 통해 모델 응답을 제공하는 서버 계층입니다.
Windows 11과 WSL2 환경에서 SWE-bench 각 작업을 별도 컨테이너로 실행하는 데 사용됐습니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.