요약은 생성됐지만 현재 화면 버전과 데이터 형식이 맞지 않아 렌더링할 수 없습니다.
출처 · 인용 안내
원문 발행 2026. 03. 04.수집 2026. 03. 04.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
아직 관련 토론이 없습니다.
댓글을 작성하려면 로그인이 필요합니다.
17:34데이터 오염을 방지하고 실제 오픈소스 유지보수 과제를 기반으로 AI 코딩 에이전트의 장기적인 문제 해결 능력을 평가하는 벤치마크 DeepSWE를 소개한다.
테스트 공개 시 모든 모델이 100% 해결했으나 동일 결과 대비 비용이 14배로 차이 났고 테스트 비공개 시 모델군별 성공률 차이와 40% 거부율이 관찰되었다.
실제 API 통합 오류가 심어진 5개 소규모 앱을 에이전트로 재현하고 증명하도록 설계된 오픈소스 저장소이다.
12:58수천만 토큰 규모의 장기 프로젝트 수행 능력을 평가하고 보상 해킹을 방지하도록 설계된 코딩 에이전트 벤치마크 SWE-Marathon을 소개한다.
2:58:44SWE-bench 환경에서 GRPO 알고리즘을 사용하여 LLM이 소프트웨어 버그를 수정하도록 학습시키는 방법과 그 구현 과정을 다룬다.