본문으로 건너뛰기

WildClawBench: 실세계의 장기 에이전트 평가를 위한 벤치마크

대규모 언어 모델(LMM/VLM) 기반 에이전트가 실세계의 멀티툴 워크플로우를 안정적으로 수행하는지 평가하기 어렵다. 기존 벤치마크는 합성 샌드박스, 짧은 시간의 작업, 모의 API 위주로 구성되어 실제 런타임에서의 도구 활용과 경로-생성(trajectory) 검증이 부족했다. WildClawBench는 60개 사람 작성 태스크를 네이티브 런타임 컨테이너에서 실행하고, 규칙-기반 평가+환경 상태 감사+LLM/VLM 판정의 하이브리드 검증으로 긴 호라이즌의 실전 워크플로우를 포착한다. 이를 통해 현 시점 프런티어 모델의 실제 활용 가능성과 한계를 보다 명확히 드러낸다.

용어 해설

네이티브 런타임(Native Runtime)
실제 생산 환경에서 에이전트가 도구를 호출하고 실행될 수 있도록 구성된 컨테이너 기반 런타임으로, 샌드박스가 아닌 실사용 도구를 통한 워크플로를 의미한다.
하이브리드 검증(Hybrid Verification)
결과의 정확성과 안전성을 보장하기 위해 규칙 기반 검사, 환경 상태 감사, 그리고 LLM/VLM 판정을 결합하는 다중 신호 체계이다.
이중언어 작업(Bilingual Tasks)
英語와 中国語(중국어)를 포함하는 다중 언어 작업 세트를 통해 언어 간 차이와 일반화 정도를 평가하는 벤치마크 구성 요소이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 05. 11.수집 2026. 05. 16.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.