본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Harness Training 프로젝트: Agent 기반 Self-improving Harness를 재구성한 PyTorch 유사 학습 프레임워크 공개
Chimera v0.4.0이 배포되었으며 M14 사이클의 벤치마크 인프라를 제공한다.
Pace: 에이전트 능력 평가를 위한 프록시
신규 모델 네 종을 동일 수수께끼로 비교한 결과 LongCat-2.0은 높은 벤치 성능에도 반복적이고 확신에 찬 허위 응답을 보였다
aarohim24/Traject — Self-hosted LLM 비용 가시성과 에이전트 궤적 압축 도구
실행할 것인가 말 것인가: LLM 기반 프로그램 수리에서 코드 실행의 비용효율성 분석
DeepSWE: 공개 코딩 벤치마크 대비 네 가지 개선점
멀티 에이전트 세션의 토큰 비대화 문제와 해결 방안
Claude Opus 4.8의 SWE-Bench Pro 성능 및 효율성 분석
Opus 4.7과 Verdent AI Manager를 활용한 자율 코딩 에이전트 구축 가이드
Codex 프롬프트 재작성을 통한 토큰 사용량 87% 절감 기법
Anthropic Opus 4.7의 정렬 실패와 벤치마크의 한계에 대한 비판
프로덕션 환경의 AI 에이전트 신뢰성 검증을 위한 EvalMonkey 공개
GitHub의 25,000개 규칙 분석: AI 에이전트 성능을 높이는 것은 '하지 말아야 할 일' 목록이다
Codeset: Git 히스토리 기반 컨텍스트 제공으로 OpenAI Codex 성능 향상 결과 공유
Meta AI의 에이전틱 코딩을 위한 추론 시점 연산 확장 논문 구현체 공개
Mythos 모델의 압도적인 SWE-bench 성능 수치와 소프트웨어 개발의 미래
AI 개발 도구의 생산성 역설: 20% 향상 보고에도 실제로는 19% 느려지는 이유
Composer 2 기술 보고서
Rust 기반 AI 에이전트용 오픈소스 로컬 메모리 레이어 'Trevec' 공개
← 피드로 돌아가기
SWE-Bench
Datasets (데이터셋)
약 56개 아티클
관련 태그:
Anthropic
Claude Code
Claude Opus 4.5
OpenAI
MCP
GPT-5.2
Cursor
Codex
DeepSeek-R1
Replit Agent