본문으로 건너뛰기

DeepSWE 소프트웨어 엔지니어링 벤치마크

DeepSWE는 장기 소프트웨어 과제와 동작 검증자를 통해 최첨단 코딩 모델을 더 엄격하게 평가한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

DeepSWE는 장기 소프트웨어 과제 113개와 수동 작성 검증자를 통해 공개 코딩 벤치마크의 한계를 보완하는 벤치마크입니다. 모든 문제를 새로 작성해 데이터 오염을 차단하고 91개 저장소·5개 언어로 과제 다양성을 확보했으며, 프롬프트는 짧지만 요구 코드량과 출력 토큰은 크게 늘려 실제 작업 난도를 반영합니다. 동일한 mini-swe-agent에서 모델을 실행해 비용·토큰·스텝을 함께 보고하므로 운영 관점에서의 비교가 가능하고, 리더보드 표는 상위 모델들이 좁은 점수대에 모이는 현상을 드러냅니다.

섹션별 상세

오늘날 공개된 최첨단 코딩 벤치마크들이 성능 상위권에서 점수 분포가 좁아 모델을 분간하기 어렵다는 문제가 있어 DeepSWE는 그 한계를 해결하려는 목적을 갖고 설계되었다. 벤치마크는 장기 과제 중심으로 113개의 과제를 수록하고 각 과제에 대해 행동 검증자(verifier)를 손수 작성하여 결과의 정합성을 판단한다. 이렇게 하면 표면적 구현 차이가 아니라 실제 동작을 기준으로 모델 성능을 구분할 수 있으므로 실제 소프트웨어 엔지니어링 업무에 더 밀접한 평가가 가능하다.
DeepSWE의 핵심 설계 중 하나는 데이터 오염을 차단하는 것이다. 기존 커밋이나 PR에서 과제를 가져오지 않고 모든 문제를 처음부터 작성함으로써 모델 사전학습에 해답이 포함되었을 가능성을 최소화한다. 이 방식은 모델이 훈련 데이터 유출로 얻은 혜택 없이 순수하게 일반화 능력으로 문제를 해결하는지를 판별하게 해 벤치마크 신뢰도를 높인다.
근거
  • DeepSWE는 문제를 기존 커밋이나 PR에서 가져오지 않고 처음부터 작성해 데이터 오염을 배제한다고 주장한다. Overview 및 Methodology 섹션의 'Contamination free' 항목과 과제 생성 방식 설명
문제 집합의 다양성은 벤치마크의 또 다른 차별점으로, 91개 저장소와 5개 프로그래밍 언어에 걸쳐 과제를 고루 배치해 특정 코드베이스 편향을 줄였다. 과제들은 프롬프트 길이가 SWE-bench Pro보다 짧음에도 불구하고 실제로 요구되는 코드 분량은 5.5배, 출력 토큰은 약 2배에 달해 모델이 단순 패턴 생성이 아닌 복잡한 코드 구성과 긴 실행 결과를 만들어내도록 유도한다. 결과적으로 다양한 언어·레포지토리 상황에서의 범용적 성능 차이를 더 잘 드러내는 구조가 된다.
근거
  • 과제들은 SWE-bench Pro보다 프롬프트는 짧지만 요구되는 코드와 출력 토큰은 훨씬 더 많아 장기 과제 성격을 띤다. Overview 섹션의 'Real-world complexity' 설명과 숫자(5.5x 더 많은 코드, ~2x 더 많은 출력 토큰)
검증 방법은 구현 세부 대신 동작을 테스트하는 자동 검증자에 초점을 맞춰 신뢰도를 확보한다. 각 과제마다 수동으로 작성한 검증 로직이 있어 함수의 반환값·런타임 동작·파일 시스템 영향 등 실제 동작 기준으로 합격 여부를 판정한다. 이 접근은 단순 문법 일치나 표면적 유사성에 의존하는 평가보다 실무 관점에서 의미 있는 통계와 실패 모드를 도출하기에 적합하다.
리더보드 결과는 여러 공개 모델을 동일한 mini-swe-agent 환경에서 실행한 산출물로, 상위 모델들이 좁은 점수대에 모이는 현상이 관찰된다. 예컨대 claude-opus-5가 Pass@1 74%로 최상위를 차지했고 gpt-5.6-sol과 gpt-5.6-terra 등이 근접한 성적을 보였다는 표가 제공된다. 비용 대비 성능과 출력 토큰 수, 에이전트 스텝 등 복수 지표를 함께 제시해 단순 순위가 아닌 운영상 고려 요소들을 평가 기준에 포함시켰다.
근거
  • 모든 모델은 비교 일관성을 위해 mini-swe-agent에서 실행되며 리더보드에 비용과 토큰 수 등 운영 지표가 포함되어 있다. 리더보드 표 하단의 'All models run on mini-swe-agent for consistency. Read why.' 문구와 표의 비용·Out tok 열
블로그는 방법론·과제 예시·한계와 향후 과제까지 함께 제시하여 재현성과 확장 가능성을 고려해 구성되었다. 과제 예시로는 서버 종료 시 읽기 작업 중단 처리, PromQL 라벨 정렬, Wasm coredump 트랩 등 현실 소프트웨어 문제를 포함하고 있어 모델 실패 모드를 구체적으로 분석할 수 있다. 한편 향후 작업에서 개선할 점과 추가할 실험 조건을 열어두어 벤치마크의 지속적 발전 경로를 명시하고 있다.

용어 해설

데이터 오염 배제(Contamination-free tasks)
모델의 사전학습에 포함되었을 가능성을 제거하기 위해 문제를 기존 커밋이나 PR에서 가져오지 않고 처음부터 작성하는 방식으로, 벤치마크가 훈련 데이터 유출의 영향을 받지 않도록 보장하는 절차와 이유를 서술한다.
장기 소프트웨어 과제(Long-horizon tasks)
단일 입력에서 요구되는 출력이 길고 구현 복잡도가 높은 작업으로, 단순 코드 스니펫을 넘는 파일 생성과 다단계 디버깅이 필요해 모델의 지속적 계획 및 상태 관리 능력을 평가하는 문제 유형이다.
동작 검증자(Verifier-based evaluation)
구현 세부가 아니라 소프트웨어 동작을 자동으로 확인하는 수단으로서, 단위 실행과 동작 검증을 통해 정답 여부를 판정하여 구현 표면이 아닌 동작 수준의 정확도를 측정하는 방법론이다.
높은 과제 다양성(High task diversity)
언어와 저장소 범위가 넓은 문제 풀집합을 사용하여 특정 코드패턴이나 리포지토리에 치우치지 않게 평가하는 설계 원칙으로, 91개 저장소와 5개 언어를 예시로 든 구성이 해당 기준을 만족한다.
미니 SWE 에이전트(mini-swe-agent)
동일한 실행 환경에서 여러 모델을 비교하기 위해 사용한 실행 인프라로서, 벤치마크의 공정성을 위해 모든 모델을 같은 에이전트 런타임에서 구동하고 비용·토큰 측정의 일관성을 확보하는 역할을 한다.

기술

  • DeepSWE
  • mini-swe-agent
  • verifier-based evaluation
  • SWE-bench Pro

활용 사례

  • 프론티어 코딩 모델의 실제 소프트웨어 개발 작업 성능 비교
  • 비용과 출력 토큰을 고려한 모델 선택 및 운영 전략 수립
  • 모델 실패 모드 분석을 통한 에이전트 안정성 개선
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 07.수집 2026. 08. 07.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.