용어 해설
- 맹목적 실행(Blind Execution)
- — 사용자의 모호하거나 불완전한 지시사항을 에이전트가 비판적 검토 없이 그대로 수용하여 코드를 생성하는 현상이다. 이는 사용자의 실제 의도와 모델의 이해 사이의 간극을 발생시켜 기능적 환각이나 UI 렌더링 오류를 초래하며, 실무 환경에서 에이전트의 신뢰성을 저해하는 주요 병목 현상으로 작용한다.
- 페르소나 기반 변이(Persona-Driven Mutation)
- — 표준적인 요구사항을 다양한 사용자 유형(미니멀리스트, 장황함, 직관적, 모순적 등)에 맞춰 의도적으로 변형하는 기법이다. 이를 통해 에이전트가 현실 세계의 노이즈가 섞인 지시사항이나 불충분한 정보를 어떻게 처리하고 명확화하는지 스트레스 테스트를 수행할 수 있다.
- 작업 완료율(Task Completion Rate (TCR))
- — 생성된 결과물이 사전에 정의된 원자적 제약 조건(Oracle Slots)을 얼마나 충족했는지 측정하는 지표이다. 단순한 코드 실행 여부를 넘어 정적 요소, 상호작용 요소, 복잡한 로직 등 각 구성 요소의 구현 난이도에 가중치를 두어 에이전트의 실제 문제 해결 능력을 정밀하게 평가한다.
코드 예제
Algorithm 1: InteractWeb-Bench Evaluation
1: // Persona-driven Initialization
2: Instruction I <- Op_persona(I*);
3: Initialize user agent Up and execution agent pi_M;
4: Initialize environment state s0, Timestep t <- 0;
5: // Interactive Agent Execution
6: while not terminated do
7: at ~ pi_M(st).
8: at in {clarify, implement, verify, submit}.
9: Execute at via (one-choice):
10: Clarify -> Interact with Up;
11: Implement -> Generate code;
12: Verify -> GUI inspection;
13: Submit -> Terminate proactively.
14: end while
15: // Final Evaluation
16: Compute final task completion rate score.InteractWeb-Bench의 전체 평가 프로세스를 정의한 알고리즘 의사코드
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.





