섹션별 상세
CVE-Bench는 실제 오픈소스 프로젝트의 취약점과 수정 사항을 기반으로 구성되었으며, 에이전트가 샌드박스 환경에서 코드를 수정하고 보안 테스트를 통과하는지 평가한다.
평가 결과 최고 성능 모델인 gpt-5.5의 해결률은 50%에 불과하며, 모델들은 코드 수정 과정에서 잘못된 파일 탐색, 예산 제한으로 인한 작업 중단, 불완전한 수정 등의 구조적 실패를 겪는다.
근거
- 최고 성능 모델인 gpt-5.5의 해결률은 50%이다. — Results section
Locate 프롬프트(위치 정보만 제공) 조건에서 모든 모델의 성능이 하락하며, 이는 모델이 코드 자체를 이해하고 취약점을 식별하는 능력이 아직 부족함을 시사한다.
비용 분석 결과, gpt-5.4-mini와 같은 소형 모델이 gpt-5.5 대비 25배 낮은 비용으로 유사한 수준의 해결률을 보여 실무 도입 시 비용 효율성이 높다.
근거
- gpt-5.4-mini는 gpt-5.5 대비 25배 낮은 비용으로 유사한 해결률을 보인다. — Limitations/Pain points section
기술
- Python
- Docker
- CVE-Bench
언급된 리소스
GitHubCVE-Bench Repository
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 05. 30.수집 2026. 05. 30.출처 타입 RSS
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

