TL;DR
자율형 에이전트가 실제 환경에서 복잡한 과업을 수행할 수 있도록 평가하는 벤치마크 연구인 WEBArena와 OSWorld를 분석한다. WEBArena는 실제 웹 서비스들을 샌드박스 형태로 구축하여 에이전트의 실행 결과가 데이터베이스에 반영되는지를 기준으로 성능을 측정하며, 단순 텍스트 매칭을 넘어선 실질적 과업 완수 능력을 검증한다. OSWorld는 이를 운영체제 전체로 확장하여 스크린샷 기반의 멀티모달 제어 능력을 평가하며, 여러 애플리케이션을 넘나드는 오픈 엔드 태스크에서의 한계를 드러낸다. 실험 결과 최신 모델들도 인간의 성능에 비해 현저히 낮은 성공률을 기록하고 있어, 복잡한 GUI 환경에서의 정교한 계획 수립과 실행 능력이 향후 에이전트 연구의 핵심 과제임을 시사한다.
챕터별 상세
자율형 에이전트의 정의와 평가의 어려움
에이전트가 도구를 사용하는 능력을 'Tool Use' 또는 'Function Calling'이라고 하며, 이는 LLM이 외부 세계와 상호작용하는 핵심 기제이다.
WEBArena: 현실적인 웹 샌드박스 환경
샌드박스(Sandbox)는 외부와 격리된 안전한 실행 환경을 의미하며, 에이전트가 실제 웹 사이트에 영향을 주지 않고 마음껏 테스트할 수 있게 한다.
{"action": "click [42]", "thought": "I need to click the login button to proceed."}WEBArena에서 에이전트가 생성하는 사고 과정과 액션의 예시
WEBArena의 태스크 설계 및 실행 기반 평가
Functional Correctness는 코딩 테스트 평가에서도 자주 쓰이는 개념으로, 코드의 형태가 아닌 실행 결과의 정확성을 검증하는 지표이다.
OSWorld: 운영체제 전반을 아우르는 멀티모달 평가
접근성 트리(Accessibility Tree)는 웹 페이지나 앱의 구조를 시각 장애인용 보조 기기가 이해할 수 있도록 트리 형태로 나타낸 데이터 구조이다.
observation, reward, done, info = env.step(action)에이전트가 환경과 상호작용하며 다음 관찰값과 보상을 받는 기본 루프
벤치마크 실험 결과 및 향후 연구 방향
GPT-4V는 텍스트와 이미지를 동시에 처리할 수 있는 멀티모달 모델로, 현재 에이전트 연구에서 가장 많이 사용되는 베이스라인 모델 중 하나이다.
용어 해설
- Autonomous Agent
- — 사용자의 구체적인 단계별 지시 없이도 주어진 목표를 달성하기 위해 스스로 계획을 세우고 도구를 사용하여 실행하는 AI 시스템이다. 웹 브라우징, 파일 편집, 이메일 전송 등 실제 환경과의 상호작용을 통해 과업을 완수하는 능력이 핵심이다.
- Benchmark
- — 모델의 성능을 정량적으로 측정하고 비교하기 위해 표준화된 데이터셋, 환경, 평가 지표를 제공하는 도구이다. 에이전트 분야에서는 모델 간의 객관적인 성능 우위를 파악하고 기술적 한계를 식별하는 중요한 기준이 된다.
- Multimodal
- — 텍스트, 이미지, 오디오 등 서로 다른 형태의 데이터를 통합하여 처리하는 기술 체계이다. 에이전트 연구에서는 화면 정보(시각)와 텍스트 명령(언어)을 결합하여 복잡한 운영체제나 웹 환경을 조작하는 데 필수적으로 활용된다.
- VLM
- — 이미지와 텍스트를 동시에 이해하고 처리할 수 있는 인공지능 모델로, 에이전트가 화면 스크린샷을 보고 상황을 판단하는 데 핵심적인 역할을 한다. GUI 환경에서 버튼의 위치나 아이콘의 의미를 파악하여 적절한 행동을 결정하는 기반이 된다.
- Functional Correctness
- — 에이전트가 수행한 작업의 결과가 의도한 목표 상태와 일치하는지를 실제 시스템의 변화(DB, 파일 등)를 통해 검증하는 방식이다. 단순한 텍스트 생성의 유사도를 측정하는 기존 방식보다 에이전트의 실질적인 문제 해결 능력을 정확하게 평가할 수 있다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.


