본문으로 건너뛰기
HF Daily Papers조회 1

AgentCompass: 에이전트 역량 통합 평가 인프라

AgentCompass는 벤치마크·하네스·환경을 분리한 모듈식 인프라로 에이전트 평가의 재현성과 확장성을 확보했다.

용어 해설

하네스(Harness)
하네스는 모델과 벤치마크 간 상호작용 로직을 책임지는 운영 레이어로서 프롬프트 포맷팅, 상태 관리, 다중턴 도구 호출, 공급자별 API 처리 등을 분리하여 재사용 가능한 실행 경로를 제공한다. 하네스는 인프로세스 방식과 샌드박스 내 서브프로세스 방식 두 가지 실행 형태를 지원하며 동일한 벤치마크를 다양한 에이전트 구성으로 실험할 수 있게 만든다. 하네스 분리는 평가 파이프라인의 재현성과 확장성을 확보하는 핵심 수단으로 기능적 경계와 데이터 계약을 정립한다.
상호작용 궤적 추적(Trajectory Tracking)
상호작용 궤적은 에이전트의 전체 실행 기록으로서 추론 단계별 행동, 도구 호출, 환경 피드백, 토큰 소비량, 지연, 중단 사유 등을 시간 순으로 저장한다. 궤적 데이터는 샘플 수준의 오류 분류와 반복성·출력잘림·보상조작 의심 행위를 탐지하는 데 사용되며 단일 스칼라 점수로는 드러나지 않는 실패 원인을 규명한다. 버전화된 궤적 저장은 재실행과 디버깅, 평가 재현성 확보를 가능하게 만든다.
실행 요청(RunRequest)(RunRequest)
RunRequest는 평가 실행을 선언적으로 기술하는 입력 사양으로서 BenchmarkSpec, HarnessSpec, EnvironmentSpec, ModelSpec, ExecutionSpec을 분리해 포함한다. 이 구조는 평가의 의미적 정의와 실행 파라미터를 명확히 분리하여 동일한 벤치마크를 다양한 하네스, 환경, 모델로 반복 실행할 수 있게 한다. 선언적 요청은 재현성 확보와 구성 간 비교를 단순화하는 역할을 한다.
준비된 작업(PreparedTask)(PreparedTask)
PreparedTask는 벤치마크가 TaskSpec을 균일한 실행 단위로 변환하여 제공하는 자료 구조로 프롬프트, 도구, 미디어, 기대 출력 등을 번들로 포함한다. 하네스는 PreparedTask를 처리하여 RunResult를 생성하고 이 계약을 통해 벤치마크와 하네스 간 데이터 교환을 엄격히 규정한다. 이 구조는 새로운 구성 요소를 도입할 때 다른 모듈의 수정을 최소화하도록 설계되었다.
애널라이저(Analyzer)
애널라이저는 저장된 궤적을 자동으로 처리해 문제 샘플을 표지하고 오류를 모델-, 환경-,프레임워크 측면으로 분류하는 플러그형 도구이다. 내장 애널라이저는 출력 잘림, 지연 급증, 반복 루프, 의심스러운 보상 조작 등 패턴을 추출해 연구자가 특정 실패 모드에 초점을 맞춰 진단할 수 있게 한다. 애널라이저는 궤적 기반 통계와 샘플 태깅을 통해 점수 외의 행동적 통찰을 제공한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 15.수집 2026. 07. 17.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.