본문으로 건너뛰기
AI Trends
피드
트렌딩
커뮤니티
탐색
보관함
로그인
홈
트렌딩
커뮤니티
보관함
프로필
관련 기사 바로가기
Harness Training 프로젝트: Agent 기반 Self-improving Harness를 재구성한 PyTorch 유사 학습 프레임워크 공개
Long-Horizon-Terminal-Bench: 밀집 보상 기반 서브태스크 채점으로 장기 터미널 과제에서 에이전트 한계 측정
LangChain의 코딩 에이전트 개선 전략: 하네스 엔지니어링을 통한 성능 극대화
LLM 터미널 능력 확장을 위한 데이터 엔지니어링 연구
← 피드로 돌아가기
Terminal-Bench
Benchmarks (벤치마크)
약 7개 아티클
관련 태그:
SWE-Bench
opus
Claude Opus 4.6
GPT-5.2 Codex
GPT-5.3 Codex
LangChain
LangSmith
Long-Horizon-Terminal-Bench
MoE
Anthropic