본문으로 건너뛰기

TUA-Bench: 범용 터미널 사용 에이전트 평가 벤치마크

명령줄 인터페이스는 명령·출력이 텍스트로 그대로 드러나기 때문에 언어 모델의 강점과 자연스럽게 정렬되는 상호작용 매체이다. 기존 벤치마크들이 GUI 중심이거나 개발자 전용 터미널 작업에 편중되어 범용 터미널 사용 능력을 충분히 측정하지 못했다는 한계가 존재한다. TUA-Bench는 120개의 실행 가능한 터미널 과제를 통해 에이전트의 계획, 도구 호출, 실행 모니터링 및 오류 복구 능력을 재현 가능하고 검증 가능한 방식으로 평가한다.

용어 해설

실행 기반 평가(Execution-grounded evaluation)
명시된 작업을 실제로 터미널 환경에서 실행하고 최종 산출물을 자동 검증기로 확인하여 성공 여부를 결정하는 평가 방식이다. 이 방식은 에이전트의 명령 실행 능력, 도구 호출, 파일 조작, 검증 가능한 결과 산출을 종합적으로 측정하며 시나리오별 최종 환경 상태를 기준으로 보상을 산정한다. TUA-Bench에서는 각 과제별로 Dockerfile과 인-환경 verifier를 포함해 동일한 초기 상태에서 재현 가능한 실행을 통해 성능을 산정한다.
Pass@k
여러 번의 독립 시도 중 상위 k개의 결과를 고려해 과제 성공을 평가하는 지표군이다. Pass@1은 단일 시도에서의 성공률을 의미하며 Pass@5는 다섯 번 시도 중 최고 결과를 기준으로 성공률을 산정한다. TUA-Bench는 Pass@1, Pass@5, All-5를 함께 보고하여 단발 해결 능력과 반복 안정성을 모두 판단한다.
Harbor 프레임워크(Harbor)
컨테이너 기반 터미널 에이전트 평가를 위한 오케스트레이션 레이어로, 작업 설정, 컨테이너 실행, 로그 수집, 트래젝토리 저장, 검증기 실행을 자동화하는 실행 인프라이다. Harbor는 독립적이고 리셋 가능한 Linux 컨테이너를 관리하며 Docker와 Podman을 지원해 재현성과 안전한 병렬 평가를 보장한다. TUA-Bench는 Harbor를 인프라로 채택해 환경 패키징과 실행-검증 파이프라인을 표준화했다.
GUI-대신 CLI 과제 변환(GUI-to-CLI conversion)
전통적으로 그래픽 인터페이스에서 수행하던 사용자의 목표를 명시적 파일·명령 기반의 터미널 과제로 재작성하는 절차이다. 변환은 입력 파일과 목표 아티팩트를 유지하되 도구 제약은 풀어 에이전트가 적절한 명령·유틸리티를 선택해 해결하도록 설계된다. TUA-Bench는 OSWorld의 GUI 과제를 이 원칙에 따라 터미널 과제로 변환해 일상적 작업을 텍스트 네이티브 환경에서 평가한다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 06. 26.수집 2026. 07. 01.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.