본문으로 건너뛰기

CVE-Bench: LLM 에이전트의 실제 보안 취약점 해결 능력 평가

20개의 실제 CVE를 대상으로 5개 LLM 에이전트의 보안 취약점 해결 능력을 평가한 결과, 최고 성능 모델도 50%의 해결률에 그쳤으며 비용 효율성 측면에서 소형 모델이 유리함이 확인됐다.

섹션별 상세

CVE-Bench는 실제 오픈소스 프로젝트의 취약점과 수정 사항을 기반으로 구성되었으며, 에이전트가 샌드박스 환경에서 코드를 수정하고 보안 테스트를 통과하는지 평가한다.
평가 결과 최고 성능 모델인 gpt-5.5의 해결률은 50%에 불과하며, 모델들은 코드 수정 과정에서 잘못된 파일 탐색, 예산 제한으로 인한 작업 중단, 불완전한 수정 등의 구조적 실패를 겪는다.
근거
  • 최고 성능 모델인 gpt-5.5의 해결률은 50%이다. Results section
Locate 프롬프트(위치 정보만 제공) 조건에서 모든 모델의 성능이 하락하며, 이는 모델이 코드 자체를 이해하고 취약점을 식별하는 능력이 아직 부족함을 시사한다.
비용 분석 결과, gpt-5.4-mini와 같은 소형 모델이 gpt-5.5 대비 25배 낮은 비용으로 유사한 수준의 해결률을 보여 실무 도입 시 비용 효율성이 높다.
근거
  • gpt-5.4-mini는 gpt-5.5 대비 25배 낮은 비용으로 유사한 해결률을 보인다. Limitations/Pain points section

기술

  • Python
  • Docker
  • CVE-Bench

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 30.수집 2026. 05. 30.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.