harveyai/harvey-labs
Python0 / 0
1671개 태스크와 실행 하니스로 법률 업무에 특화된 에이전트 평가를 지원합니다.
TL;DR
이 레포는 법률 업무 전용으로 설계된 오픈소스 벤치마크로서, 1671개의 태스크와 에이전트 실행·채점 하니스를 함께 제공합니다. 문서화된 튜토리얼과 아키텍처·평가 방법론 문서를 통해 에이전트 실행부터 리포트·대시보드 비교까지 재현할 수 있습니다. MIT 라이선스라 사용 제약이 적고, 실제 실험에는 에이전트 어댑터·도구 통합 작업이 필요하다는 점을 고려해야 합니다.
핵심 포인트
- 레포는 법률 업무를 모사한 태스크 데이터셋과 그 태스크에 에이전트를 배치해 실행·채점하는 실행 하니스(harness)를 함께 제공하는 벤치마크 프로젝트입니다. 태스크 페이로드에는 에이전트 지시문, 관련 문서, 그리고 채점용 루브릭이 포함되어 있어 입력→처리→출력의 평가 흐름을 바로 재현할 수 있습니다. 공개된 자료와 튜토리얼로 에이전트 실행부터 보고서·대시보드 비교까지 한 번에 실행해 성능을 비교할 수 있습니다.
- 구성과 사용 흐름은 문서화가 잘 되어 있으며 시작점으로 docs/tutorial.md에 M&A 데이터룸 과제를 끝까지 따라 하는 전체 워크플로우가 제공됩니다. 아키텍처 문서에서는 태스크 모델, 하니스, 도구와 어댑터, 리포트 및 스윕(sweeps) 동작 방식을 다루므로 기존 에이전트 파이프라인과의 통합 방식(예: 어댑터 연결, 평가 루프 호출)을 구현할 때 참고할 수 있습니다. 또한 평가 방법론 문서에서 'All-pass rubric scoring'과 LLM judge 행동 규칙을 제시해 자동 채점의 입력·판정 기준을 확인할 수 있습니다.
- 프로젝트는 지속적으로 확장·수정되는 진행형이며 MIT 라이선스로 제약이 적습니다. 현재 태스크 수는 1671개이고 법률 실무 영역 표시는 24개(plus contracting)로 법률 전용 평가가 명확히 목표로 잡혀 있습니다. 레포 자체는 모델을 포함하지 않는 데이터셋·하니스 성격이며, 실제 실험을 위해서는 사용하는 에이전트 인터페이스에 맞춘 어댑터 개발이나 도구 연결 작업이 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Tasks | count | 1671 | — |
| Legal practice areas | areas | 24 + contracting | — |
| License | type | MIT | — |
| Repository popularity | stars/forks | 803 stars, 174 forks | — |
803
Stars
174
Forks
+207
Trending
0
조회수
803 watchers45 open issuesMIT License
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.