harbor-framework/terminal-bench-science
Python0 / 0
과학 연구 분야 전문가가 설계한 70개 이상의 태스크로 AI 에이전트의 연구 워크플로우 수행 능력을 평가하는 벤치마크 프레임워크.
TL;DR
Terminal-Bench-Science는 과학 연구 워크플로우에서 AI 에이전트의 실질적 역량을 측정하기 위해 설계된 커뮤니티 기반 벤치마크이다. 생명, 물리, 지구, 수학, 공학 분야의 전문가들이 직접 설계하고 검수한 70개 이상의 태스크를 포함하며, Harbor 프레임워크를 통해 지속적으로 확장된다. 엄격한 QA 파이프라인을 통해 태스크의 무결성을 검증하며, 과학계의 요구사항을 AI 개발에 반영하는 피드백 루프를 구축한다. 연구 현장의 복잡한 문제를 해결해야 하는 AI 에이전트의 성능을 정량적으로 평가하려는 개발자에게 적합하다.
핵심 포인트
- 과학 연구 워크플로우에 특화된 AI 에이전트 성능 평가 벤치마크이다.
- 생명, 물리, 지구, 수학, 공학 등 5개 과학 분야의 전문가가 직접 설계한 70개 이상의 태스크를 제공한다.
- Harbor 프레임워크를 기반으로 Docker 빌드, 오라클 검증, 유사도 체크 등 엄격한 QA 파이프라인을 수행한다.
- 과학계 전문가와 AI 개발자 간의 피드백 루프를 형성하여 실제 연구 현장에 필요한 AI 역량을 지속적으로 측정한다.
이미지 분석
361
STARS
288
FORKS
+211
TRENDING
0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.