본문으로 건너뛰기

Ox alpha의 SWE-bench 96% 기록과 검증 한계

Ox alpha가 SWE-bench Verified-Mini에서 96%를 기록했지만 데이터 오염과 표본 편향 때문에 상한선으로 봐야 합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

작성자는 공식 mini-swe-agent Bash-Only 스캐폴드와 SWE-bench Docker harness를 이용해 Ox alpha를 50개 작업에 평가한 결과 48개 해결, 96.0%를 얻었습니다. 하지만 평가는 Django와 Sphinx에 한정된 mini-50 집합에서 이뤄졌고, 두 저장소가 학습 데이터에 포함됐을 가능성, 50개뿐인 표본, 2019~2022년 작업, 무료 모델 엔드포인트와 같은 오염 및 비교 한계가 있습니다. 전체 500개 작업과 12개 저장소를 대상으로 한 다른 Bash-Only 결과가 약 72~77%인 점을 고려하면, 96%는 Fable 5를 능가하는 확정적 순위가 아니라 Ox alpha의 성능 상한선으로 해석해야 합니다. 그럼에도 모든 작업에서 실제 패치를 제출하고 50개 중 48개를 통과시킨 결과는 에이전트형 코딩 능력이 매우 강할 가능성을 뒷받침합니다.

섹션별 상세

01
작성자는 공식 Bash-Only 리더보드와 같은 mini-swe-agent v2.4.6 스캐폴드로 Ox alpha를 SWE-bench Verified-Mini 50개 작업에 실행했습니다. 모델은 opencode의 Go gateway를 통해 제공됐고, 공식 swebench.yaml 도구 호출 템플릿과 250단계 제한을 사용했습니다. Docker Desktop과 WSL2 환경에서 각 인스턴스를 별도 컨테이너로 실행해 공식 SWE-bench harness로 채점했습니다.
02
Ox alpha는 50개 중 48개를 해결해 96.0%를 기록했고, 50개 모두 실제 패치를 제출해 빈 패치나 오류는 없었습니다. 평균 실행 단계는 40회, 최대 단계는 116회였으며 4개 병렬 작업자의 전체 실행 시간은 약 2시간 4분이었습니다. 저장소별 결과는 django 23/25, sphinx-doc 25/25였고 실패 항목은 django__django-11790과 django__django-11815였습니다.
03
작성자는 이 수치를 Claude Fable 5의 95%와 비교했지만, 두 점수가 같은 조건에서 나온 것은 아니라고 구분했습니다. Fable 5의 수치는 Anthropic이 튜닝한 에이전트 스캐폴드와 500개 전체 작업에서 얻은 값인 반면, Ox alpha의 96%는 django와 sphinx-doc만 포함한 50개 부분집합에서 공식 Bash-Only 스캐폴드로 얻은 값입니다. 같은 Bash-Only 조건의 전체 500개 기준으로는 Claude 4.5 Opus high reasoning 76.8%, Gemini 3 Flash high reasoning 75.8%, GPT-5.2 72.8%가 제시됐습니다.
04
작성자는 SWE-bench Verified-Mini의 높은 점수를 일반적인 코딩 능력의 확정적 증거로 보지 말아야 한다고 했습니다. 평가 집합이 Django와 Sphinx처럼 LLM 학습 데이터에 많이 포함됐을 가능성이 있는 저장소로만 구성되고, 모든 작업이 2019~2022년 PR이며, 표본도 50개에 불과하기 때문입니다. OpenAI의 사람 난이도 주석에서는 1시간 초과 작업 비율이 mini-50에서 16%, 전체 500개에서 9%로 나타나 mini-50이 단순히 가장 쉬운 문제만 모은 집합은 아니지만, 작성자는 96%를 비교 가능한 최종 점수가 아니라 상한선으로 취급해야 한다고 결론 내렸습니다.

용어 해설

SWE-bench
실제 소프트웨어 저장소의 이슈와 수정 PR을 바탕으로 코딩 에이전트가 버그를 고치는 능력을 평가하는 벤치마크입니다. 에이전트가 패치를 제출한 뒤 저장소별 테스트를 실행해 모든 FAIL_TO_PASS와 PASS_TO_PASS 조건을 통과한 작업만 해결된 것으로 계산합니다.
에이전트 스캐폴드(Agent Scaffold)
모델이 코딩 작업을 수행할 때 사용할 도구 호출 형식, 프롬프트, 실행 절차와 단계 제한을 묶은 실행 틀입니다. 같은 스캐폴드를 적용하면 모델 자체의 차이를 비교하기 쉬워지지만, 제작사가 별도로 튜닝한 스캐폴드와는 점수를 직접 비교하기 어렵습니다.
데이터 오염(Contamination)
평가에 사용되는 문제나 해결 과정이 모델의 학습 데이터에 이미 포함되어 성능이 실제 일반화 능력보다 높아지는 현상입니다. 이 글에서는 2019~2022년의 Django와 Sphinx 작업이 학습 데이터에 들어갔을 가능성이 SWE-bench 점수를 부풀릴 수 있는 요인으로 거론됩니다.
FAIL_TO_PASS 테스트(FAIL_TO_PASS)
원래 실패하던 테스트가 제출된 패치 적용 후 통과해야 한다는 SWE-bench 평가 조건입니다. 이 조건만이 아니라 기존에 통과하던 PASS_TO_PASS 테스트까지 모두 통과해야 작업이 해결된 것으로 집계되므로, 패치가 일부 기능만 고친 경우에는 성공으로 계산되지 않습니다.

언급된 도구

mini-swe-agent중립

SWE-bench 작업에서 Bash 명령을 실행하고 모델의 패치 제출 절차를 관리하는 공식 에이전트 스캐폴드입니다.

opencode중립

Ox alpha를 실행 환경에 연결하고 Go gateway를 통해 모델 응답을 제공하는 서버 계층입니다.

Docker Desktop중립

Windows 11과 WSL2 환경에서 SWE-bench 각 작업을 별도 컨테이너로 실행하는 데 사용됐습니다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 22.수집 2026. 08. 22.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.