본문으로 건너뛰기

SWE-Marathon: 장기 자율 소프트웨어 개발을 위한 벤치마크

수천만 토큰 규모의 장기 프로젝트 수행 능력을 평가하고 보상 해킹을 방지하도록 설계된 코딩 에이전트 벤치마크 SWE-Marathon을 소개한다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기존 코딩 벤치마크가 단기적인 문제 해결에 집중했다면, SWE-Marathon은 수천만에서 수억 개의 토큰이 소요되는 실제 프로젝트 규모의 장기 자율 작업을 평가하기 위해 설계됐다. 제품 클론, 라이브러리 재작성, ML 엔지니어링 등 20개의 복잡한 과제를 통해 에이전트의 지속적인 추론과 실행 능력을 측정한다. 특히 풀스택 평가를 위해 컴퓨터 사용 검증기를 도입하고, 에이전트가 평가 지표의 허점을 이용하는 보상 해킹을 방지하는 데 중점을 두었다. 이를 통해 단순한 코드 생성을 넘어 실제 소프트웨어 개발 환경에서의 자율성을 엄격하게 검증할 수 있는 기준을 제시한다.

챕터별 상세

00:00

SWE-Marathon 벤치마크 개요

기존 벤치마크의 한계를 극복하고 실제 소프트웨어 엔지니어링 프로젝트 규모의 과제를 수행하는 에이전트를 평가하기 위해 개발됐다. 제품 클론이나 라이브러리 재작성 등 20개의 고난도 태스크를 포함한다. 에이전트가 단순한 버그 수정을 넘어 전체 시스템을 구축하거나 대규모 리팩터링을 수행하는 능력을 측정하는 것이 핵심이다.

SWE-bench와 같은 기존 벤치마크보다 훨씬 더 긴 호흡의 작업을 요구한다.

03:00

장기 호흡(Long-horizon) 작업의 도전 과제

에이전트가 수천만에서 수억 개의 토큰을 소모하며 장시간 작업을 지속할 때 발생하는 추론의 일관성과 오류 복구 문제를 다룬다. 단순한 함수 작성을 넘어 시스템 전체의 맥락을 유지하는 능력이 핵심이다. 작업이 길어질수록 에이전트가 목표를 잃지 않고 복잡한 의존성을 관리하는 능력이 중요해진다.

토큰 소모량이 많아질수록 모델의 컨텍스트 윈도우 관리와 장기 기억 능력이 시험대에 오른다.

06:00

컴퓨터 사용 검증기(Computer-use Verifier)의 역할

풀스택 개발 환경에서 에이전트가 실제로 의도한 대로 동작하는지 확인하기 위해 GUI나 터미널을 직접 확인하는 검증 방식을 도입했다. 이는 단순 유닛 테스트만으로는 확인하기 어려운 사용자 경험과 통합 기능을 평가하는 데 필수적이다. 에이전트가 브라우저를 열어 UI를 확인하거나 서버 로그를 분석하는 과정을 검증에 포함한다.

코드의 논리적 정확성뿐만 아니라 실제 실행 환경에서의 동작을 보장하기 위한 장치다.

09:00

보상 해킹(Reward-hacking) 저항성 설계

에이전트가 문제의 본질을 해결하지 않고 평가 시스템의 취약점을 이용해 점수를 따는 행위를 방지하기 위한 벤치마크 설계 원칙을 논의한다. 엄격한 검증 로직을 통해 에이전트의 실제 문제 해결 능력을 변별력 있게 측정한다. 보상 함수가 단순할 때 에이전트가 지름길을 찾는 현상을 막기 위해 다각도의 검증 지표를 설정했다.

강화학습 기반 에이전트에서 흔히 발생하는 문제로, 벤치마크의 신뢰성을 위해 반드시 해결해야 할 과제다.

용어 해설

장기 과제(Long-horizon Task)
에이전트가 수천 단계 이상의 복잡한 추론과 실행을 거쳐야 해결할 수 있는 긴 호흡의 작업을 의미한다. 단순한 코드 조각 생성을 넘어 전체 시스템의 아키텍처를 이해하고 지속적으로 목표를 추적하는 능력을 평가하는 데 중요하다.
보상 해킹(Reward-hacking)
AI 모델이 설계자가 의도한 진정한 목표를 달성하는 대신, 평가 지표나 보상 함수의 허점을 찾아내어 점수만 높게 받는 현상이다. 벤치마크의 신뢰성을 떨어뜨리므로 이를 방지하는 견고한 설계가 필수적이다.
코딩 에이전트(Coding Agent)
소프트웨어 개발 작업을 자율적으로 수행하도록 설계된 AI 시스템이다. 코드 작성뿐만 아니라 디버깅, 테스트 실행, 환경 설정 등 개발 전 과정을 스스로 판단하고 실행하는 능력을 갖춘다.
검증기(Verifier)
에이전트가 수행한 작업의 결과물이 요구 사항을 정확히 충족했는지 자동으로 판별하는 도구다. SWE-Marathon에서는 풀스택 환경의 동작을 확인하기 위해 컴퓨터 사용 기반의 검증 방식을 사용한다.

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 07.수집 2026. 07. 07.출처 타입 YOUTUBE

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.