실용적 조언
- AI 에이전트를 개발 중이라면 ClawBench의 5계층 행동 데이터(스크린샷, 트래픽 등)를 활용해 모델의 실패 지점을 정밀하게 분석할 수 있다.
- pip install clawbench-eval을 통해 자신의 모델을 실제 웹 환경에서 즉시 테스트해볼 수 있다.
섹션별 상세
ClawBench는 샌드박스가 아닌 실제 운영 중인 144개 라이브 웹사이트에서 153개의 일상적 과업을 수행하도록 설계됐다. 에이전트가 웹 UI와 상호작용하며 발생하는 세션 재생, 스크린샷, HTTP 트래픽, 추론 추적, 브라우저 액션 등 5개 계층의 행동 데이터를 수집하여 분석한다. 이를 통해 인위적인 환경이 아닌 실제 웹 환경에서의 복잡한 동적 요소를 에이전트가 얼마나 잘 처리하는지 검증한다.
안전한 평가를 위해 결제나 예약 등 되돌릴 수 없는 동작 직전에 HTTP 요청을 차단하는 리퀘스트 인터셉터 기술을 도입했다. 에이전트가 최종 확정 버튼을 누르더라도 실제 서버로 요청이 가기 전에 가로채어 금전적 손실이나 데이터 오염 없이 실물 사이트 테스트가 가능하다. 이러한 메커니즘은 실제 서비스 환경을 훼손하지 않으면서도 에이전트의 최종 의사결정 단계까지 평가할 수 있는 안전장치 역할을 한다.
성능 평가 결과 최고 모델인 Claude Sonnet 4.6조차 33.3%의 낮은 성공률을 기록하며 현세대 에이전트의 한계를 드러냈다. 금융 및 학술 과업은 약 50%의 성공률을 보였으나 여행이나 개발 관련 과업은 훨씬 더 낮은 수치를 기록하여 도메인별 난이도 차이가 큼이 확인됐다. 특히 텍스트 전용 모델인 GLM-5가 24.2%로 2위를 차지한 점은 시각 정보 없이도 강력한 추론 능력이 브라우징에 기여할 수 있음을 시사한다.
용어 해설
- 브라우저 에이전트(Browser Agent)
- — 웹 브라우저 내에서 사용자를 대신해 클릭, 입력, 탐색 등의 작업을 수행하는 AI 시스템이다. 단순한 텍스트 생성을 넘어 실제 웹 환경의 UI 요소를 인식하고 상호작용하여 복잡한 태스크를 완료하는 능력이 핵심이다.
- 지상 검증 데이터(Ground Truth)
- — 모델의 성능을 평가할 때 정답으로 간주되는 실제 데이터이다. 이 벤치마크에서는 사람이 직접 수행하여 확인한 작업 결과와 과정을 기준으로 AI 에이전트의 성공 여부를 판가름한다.
- 에이전트 기반 평가기(Agentic Evaluator)
- — 단순한 규칙 기반 검사가 아니라 AI 에이전트가 다른 에이전트의 행동 추적과 실행 단계를 분석하여 성공 여부를 진단하는 방식이다. 단계별 추적 가능한 진단 기능을 통해 실패 원인을 구체적으로 파악할 수 있게 한다.
- 요청 가로채기(Request Interceptor)
- — 네트워크 트래픽이 서버로 전송되기 전에 중간에서 가로채는 기술이다. 실제 웹사이트에서 결제나 예약 같은 되돌릴 수 없는 동작이 실행되기 직전에 차단함으로써 안전한 벤치마크 환경을 구축하는 데 사용된다.
코드 예제
bash
pip install clawbench-evalClawBench 평가 도구를 설치하는 명령어
언급된 도구
실제 웹사이트 기반 AI 브라우저 에이전트 성능 평가 벤치마크
clawbench-eval추천
ClawBench 벤치마크 실행 및 평가를 위한 Python 라이브러리
AI 분석 전체 내용 보기
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
원문 발행 2026. 04. 15.수집 2026. 04. 15.출처 타입 REDDIT
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.