관련 기사 바로가기
Terminal-Bench 4.0: 지속적인 벤치마크를 위한 품질 보증 파이프라인2026년 AI 코딩 에이전트 오픈소스 벤치마크 10선코딩 에이전트의 정의와 성능 평가를 위한 벤치마크 연구 동향.엔터프라이즈용 에이전트형 AI의 인프라 교훈과 용량 설계AI 에이전트 평가 및 최적화를 위한 롤아웃 중심 프레임워크Harness Training 프로젝트: Agent 기반 Self-improving Harness를 재구성한 PyTorch 유사 학습 프레임워크 공개Long-Horizon-Terminal-Bench: 밀집 보상 기반 서브태스크 채점으로 장기 터미널 과제에서 에이전트 한계 측정LangChain의 코딩 에이전트 개선 전략: 하네스 엔지니어링을 통한 성능 극대화LLM 터미널 능력 확장을 위한 데이터 엔지니어링 연구Qwen3-Coder-Next 기술 보고서
← 피드로 돌아가기
Terminal-Bench
약 13개 아티클
관심 태그 추가
관련 태그:SWE-benchSnorkel AIProgramBenchClaude Opus 4.6HarborIntelGPT-5.3 CodexLangSmithLong-Horizon-Terminal-BenchLangChain
TIMEHEADLINE