본문으로 건너뛰기

UniClawBench: 실환경에서 능동형 에이전트를 진단하는 능력 중심 벤치마크

UniClawBench는 5개 핵심 능력에 따라 400개의 이중언어 실세계 과제를 Docker 기반 실환경에서 폐쇄 루프 평가로 측정하는 능력 중심 벤치마크이다.

용어 해설

능동형 에이전트(Proactive Agent)
사용자 지시를 기다리지 않고 목표를 자율적으로 추구하고 도구를 호출해 작업을 수행하는 에이전트 개념으로, 상태 유지·스킬 호출·장기 계획 역량을 결합하여 개인 비서 수준의 자동화를 목표로 한다.
폐쇄형 반복 평가(Closed-Loop Evaluation)
에이전트의 중간 산출물에 대해 사용자형 피드백을 여러 차례 주고받으며 수행을 완결하는 평가 방식으로, 단회 응답이 아닌 반복적 상호작용을 통한 오류 복구 능력을 측정한다.
비공개 감독자(Hidden Supervisor)
평가기준과 참조를 독립적으로 보유하며 실행 궤적과 산출물을 세부 체크포인트 기반 루브릭으로 채점하는 내부 평가자 역할로, 외부 피드백 에이전트에 채점 기준을 누설하지 않도록 설계된다.
사용자 시뮬레이터(User Simulator)
에이전트가 작성한 가시적 결과만을 바탕으로 자연어 피드백을 생성하는 역할로, 실제 사용자가 줄 수 있는 교정·추가요구를 흉내내되 채점 참조에는 접근하지 못하도록 정보격벽을 유지한다.
능력 중심 분류법(Capability-Driven Taxonomy)
작업을 도메인 대신 핵심 역량(예: Skill Usage, Exploration, Long-Context, Multimodal, Cross-Platform)별로 분류하여 실패 원인을 더 정확히 규명할 수 있게 하는 과제 설계 원칙이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 09.수집 2026. 07. 11.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.