harbor-framework/harbor
Python0 / 0
Harbor는 Terminal-Bench 제작진이 만든 벤치마크 실행 하니스로서 에이전트와 언어 모델을 대규모 병렬로 평가하고 RL용 롤아웃을 생성하는 기능을 제공한다.
TL;DR
Harbor는 Terminal-Bench 제작진이 제공하는 평가 하니스로서 에이전트와 언어 모델을 동일한 인터페이스로 실행해 결과를 수집하고 RL용 롤아웃을 생성한다. 내부적으로 로컬 Docker 실행과 Daytona·Modal·LangSmith 등 원격 제공자 연동을 통해 수천 개 환경에서 병렬로 실험을 수행하며 CLI 명령어로 dataset·agent·model을 지정해 재현 가능한 벤치마크를 실행한다. Cookbook과 문서 링크가 함께 제공되어 실제 구성과 재현이 용이하며 API 키를 통한 제공자 접근과 Docker 사용이 전제 조건이다. 결과적으로 대규모 비교 실험과 자동화된 롤아웃 수집 워크플로가 필요한 연구와 엔지니어링 작업의 반복 비용을 줄인다. 이 레포는 벤치마크 재현성과 제공자 확장을 중시하는 실무·연구 환경에서 바로 활용 가능하다.
핵심 포인트
- Terminal-Bench의 공식 하니스 역할을 수행한다. Harbor는 Terminal-Bench 제작진이 구축한 도구이므로 해당 벤치마크와의 호환성·재현성이 우수하며 Cookbook과 문서가 연동되어 실제 예제 기반 실험 구성이 수월하다. 이 연계성은 기존 일반적인 벤치마크 실행 스크립트와 비교해 초기 설정 비용을 낮춘다.
- 다양한 원격 제공자와 통합하여 대규모 병렬 실행을 지원한다. Daytona, Modal, LangSmith, Blaxel, Novita Sandbox 같은 제공자와의 연결을 통해 로컬 자원 한계를 넘는 동시성으로 실험을 확장할 수 있다. 제공자별 프로비저닝을 추상화해 사용자는 동일한 CLI로 로컬과 클라우드 실행을 전환할 수 있다.
- 롤아웃 생성과 결과 수집을 워크플로에 내장하고 있다. 에이전트 상호작용 로그를 표준화된 형식으로 저장해 RL 최적화와 분석 파이프라인으로 바로 전달할 수 있게 한다. 이 기능은 별도 수집 스크립트 없이도 학습 데이터와 평가 데이터를 확보하게 해 연구 생산성을 높인다.
- 에이전트를 평가한다. Harbor는 Claude Code, OpenHands, Codex CLI 등 임의의 에이전트를 동일한 인터페이스로 실행해 결과를 수집하고 비교할 수 있게 한다. 수집된 결과는 벤치마크 재현과 성능 분석에 바로 활용된다.
3.8k
Stars
1.5k
Forks
+204
Trending
0
조회수
3.8k watchers628 open issuesApache License 2.0
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.