TL;DR
기존 코딩 벤치마크가 단일 함수의 테스트 통과 여부에 집중했다면, 에이전틱 코딩 벤치마크는 실제 저장소와 터미널에서 파일 수정, 명령어 실행, 디버깅, 테스트, 장기 작업을 수행하는 능력을 측정합니다. SWE-bench는 실제 GitHub 이슈 해결의 표준 기준선이고 Terminal-Bench는 터미널 도구 사용을 평가하며, ProgramBench는 바이너리와 문서만으로 전체 프로그램을 재구축하게 합니다. Senior SWE-Bench, DeepSWE, SlopCodeBench, Multi-SWE-bench 등은 유지보수성, 새로 작성된 장기 과제, 반복 개발의 구조적 안정성, 다언어 저장소 처리로 평가 범위를 넓힙니다. 어떤 단일 벤치마크도 전체 능력을 대표하지 않으므로 이슈 해결, 도구 사용, 설계 품질, 반복 작업, 전체 시스템 구축을 함께 확인해야 합니다.
섹션별 상세
- SWE-bench는 12개 Python 저장소의 실제 소프트웨어 엔지니어링 작업 2,294개를 포함한다. — SWE-bench 항목의 데이터셋 규모와 저장소 설명 문단
- SWE-Bench Pro에는 41개 유지보수 저장소의 문제 1,865개가 있으며 약 30%의 데이터셋 품질 문제가 감사에서 제기됐다. — SWE-Bench Pro 항목의 데이터셋 구성과 2026년 OpenAI 감사 관련 문단
- Senior SWE-Bench의 초기 공개판은 12개 오픈소스 저장소에 걸친 100개 과제로 구성된다. — Senior SWE-Bench 항목의 초기 릴리스 구성 문단
- Agents' Last Exam은 13개 산업군의 55개 하위 영역을 다루며 GPT-5.6 Sol 출시에서 53.6의 최고 기록을 세웠다. — Agents' Last Exam 항목의 범위와 GPT-5.6 Sol 기록 문단
- SlopCodeBench는 20개 문제와 93개 체크포인트로 반복적 요구사항 변경에 따른 품질 저하를 추적한다. — SlopCodeBench 항목의 문제 수, 체크포인트, 측정 지표 문단
- ProgramBench는 200개 과제와 248,000개가 넘는 행동 테스트를 사용한다. — ProgramBench 항목의 과제 수와 에이전트 기반 퍼징 테스트 수 문단
이미지 분석

이미지 상단에는 AI 코딩 에이전트를 위한 오픈소스 벤치마크 10선이라는 제목이 있고, 하단에는 코드, 터미널, 테스트, 검색, 워크플로와 관련된 아이콘이 1번부터 10번까지 배열돼 있습니다. 본문에서 제시한 여러 평가 축과 연결되는 시각 자료이지만, 각 아이콘이 특정 벤치마크 이름이나 수치를 직접 구분해 보여주지는 않습니다.
AI 코딩 에이전트 평가를 위한 2026년 오픈소스 벤치마크 10선을 나타낸 인포그래픽입니다.
용어 해설
- 에이전틱 코딩 벤치마크(Agentic Coding Benchmark)
- — AI 에이전트가 단일 코드 생성이 아니라 실제 저장소 안에서 파일을 찾고 수정하며, 명령어와 테스트를 실행하고 오류를 고치는 능력을 측정하는 평가 체계입니다. 장기 작업, 도구 사용, 유지보수성까지 포함해 소프트웨어 엔지니어링에 가까운 성능을 확인합니다.
- 장기 작업(Long-Horizon Task)
- — 한 번의 응답으로 끝나지 않고 여러 단계의 계획과 실행, 검증을 거쳐야 완료되는 작업입니다. 코딩 에이전트 평가에서는 저장소 탐색, 구현, 테스트, 디버깅을 반복하며 긴 작업 흐름을 유지하는 능력을 뜻합니다.
- 실행 하네스(Execution Harness)
- — 모델을 격리된 실행 환경과 연결해 명령어 실행, 파일 변경, 테스트 결과를 관찰할 수 있게 하는 평가 구성 요소입니다. Terminal-Bench처럼 실제 터미널 작업을 재현 가능한 방식으로 측정할 때 사용됩니다.
- 에이전트 기반 퍼징(Agent-Driven Fuzzing)
- — 프로그램에 다양한 입력을 자동으로 주입해 예상 동작과 실제 동작의 차이를 찾는 테스트 방식입니다. ProgramBench는 이 방법으로 248,000개가 넘는 행동 테스트를 생성해 완성된 프로그램의 동작 일치 여부를 평가합니다.
- 경로 의존성(Path Dependence)
- — 초기 구현이나 설계 선택이 이후 수정과 확장 결과에 누적 영향을 미치는 현상입니다. SlopCodeBench는 요구사항이 여러 차례 바뀌는 상황에서 초기 선택이 코드 품질 저하, 비수렴, 구조적 불안정으로 이어지는지 측정합니다.
기술
- SWE-bench
- Terminal-Bench
- SWE-Bench Pro
- Senior SWE-Bench
- Agents' Last Exam
- DeepSWE
- SlopCodeBench
- Multi-SWE-bench
- ProgramBench
- Aider Polyglot
- Python
- TypeScript
- Go
- JavaScript
- Rust
- Java
- C
- C++
활용 사례
- 서로 다른 AI 코딩 에이전트의 저장소 수준 이슈 해결 능력을 비교하는 평가에 활용할 수 있습니다. SWE-bench와 SWE-Bench Pro가 실제 코드베이스 수정과 테스트 통과 여부를 측정하므로 패치 생성 성능을 비교하기에 적합합니다.
- 터미널 명령어 실행과 장기적인 디버깅 흐름을 평가하는 데 활용할 수 있습니다. Terminal-Bench는 컴파일, 의존성 설치, 테스트, 오류 수정까지 포함해 실제 개발 환경에 가까운 작업 수행력을 확인합니다.
- 반복적인 요구사항 변경과 전체 프로그램 구축 능력을 확인하는 데 활용할 수 있습니다. SlopCodeBench는 누적적인 구조 붕괴를, ProgramBench는 바이너리와 문서에서 출발한 완전한 프로그램 재구성을 측정합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

