본문으로 건너뛰기

agentic-coding-benchmark

에이전틱 코딩 벤치마크

AI 에이전트가 단일 코드 생성이 아니라 실제 저장소 안에서 파일을 찾고 수정하며, 명령어와 테스트를 실행하고 오류를 고치는 능력을 측정하는 평가 체계입니다. 장기 작업, 도구 사용, 유지보수성까지 포함해 소프트웨어 엔지니어링에 가까운 성능을 확인합니다.