관련 기사 바로가기
2026년 AI 코딩 에이전트 오픈소스 벤치마크 10선BRONCO로 AI 벤치마크의 측정 타당도 검증비교 진화로 스스로 개선하는 코딩 에이전트기업 환경을 위한 지속적 학습과 모델 증류 방법론.코딩 에이전트의 정의와 성능 평가를 위한 벤치마크 연구 동향.Cognition의 Russell Kaplan이 말하는 AI 에이전트의 미래와 소프트웨어 엔지니어링의 변화.Harness Training 프로젝트: Agent 기반 Self-improving Harness를 재구성한 PyTorch 유사 학습 프레임워크 공개Chimera v0.4.0이 배포되었으며 M14 사이클의 벤치마크 인프라를 제공한다.신규 모델 네 종을 동일 수수께끼로 비교한 결과 LongCat-2.0은 높은 벤치 성능에도 반복적이고 확신에 찬 허위 응답을 보였다aarohim24/Traject — Self-hosted LLM 비용 가시성과 에이전트 궤적 압축 도구실행할 것인가 말 것인가: LLM 기반 프로그램 수리에서 코드 실행의 비용효율성 분석멀티 에이전트 세션의 토큰 비대화 문제와 해결 방안Claude Opus 4.8의 SWE-Bench Pro 성능 및 효율성 분석Meta AI의 에이전틱 코딩을 위한 추론 시점 연산 확장 논문 구현체 공개Opus 4.7과 Verdent AI Manager를 활용한 자율 코딩 에이전트 구축 가이드Codex 프롬프트 재작성을 통한 토큰 사용량 87% 절감 기법Anthropic Opus 4.7의 정렬 실패와 벤치마크의 한계에 대한 비판LLM 벤치마크는 과학인가 마케팅인가Pace: 에이전트 능력 평가를 위한 프록시DeepSWE: 공개 코딩 벤치마크 대비 네 가지 개선점