본문으로 건너뛰기

SWE-benchmark

소프트웨어 엔지니어링 벤치마크

AI 모델이 실제 소프트웨어 개발 과제를 얼마나 잘 수행하는지 측정하는 지표로, 코드 수정 및 버그 해결 능력을 평가한다.