본문으로 건너뛰기

관련 기사 바로가기

프로덕션 환경의 AI 에이전트 신뢰성 검증을 위한 EvalMonkey 공개GitHub의 25,000개 규칙 분석: AI 에이전트 성능을 높이는 것은 '하지 말아야 할 일' 목록이다Mythos 모델의 압도적인 SWE-bench 성능 수치와 소프트웨어 개발의 미래Codeset: Git 히스토리 기반 컨텍스트 제공으로 OpenAI Codex 성능 향상 결과 공유AI 개발 도구의 생산성 역설: 20% 향상 보고에도 실제로는 19% 느려지는 이유Composer 2 기술 보고서Rust 기반 AI 에이전트용 오픈소스 로컬 메모리 레이어 'Trevec' 공개Claude의 추론 과정을 위한 Git 방식의 버전 관리 도구 h5iCursor, 벤치마크 성능 대폭 향상된 자체 코딩 모델 Composer 2 출시SWE-Skills-Bench: 에이전트 스킬이 실제 소프트웨어 공학에서 정말 도움이 되는가?소음 제거: LLM 기반 에이전트를 위한 더 스마트한 컨텍스트 관리LLM 코딩 능력의 정체: 테스트 통과율과 실제 머지율의 괴리 분석Anthropic 증류 기법과 모델의 벤치마크 오염: SWE-bench의 종말?Auggie CLI, SWE-bench Pro 벤치마크에서 1위 달성효과적인 AI 에이전트 평가 구축 가이드Claude Opus 4.5와 함께하는 모바일 앱 바이브 코딩: Anthropic의 새로운 플래그십 모델 분석Gemini 3 Flash: 속도를 위해 설계된 프론티어 지능Replit의 스냅샷 엔진이 AI 에이전트를 안전하게 만드는 방법: 파일시스템 포크와 버전 관리 데이터베이스리더보드 점수를 넘어 실전 AI 시스템으로: AI21 CTO가 밝히는 4가지 핵심 격차Konwinski Prize 우승자 Eduardo Rocha de Andrade의 솔루션 발표
← 피드로 돌아가기

SWE-bench

Datasets (데이터셋)

63개 아티클

관심 태그 추가
TIMEHEADLINE