본문으로 건너뛰기
HF Daily Papers조회 1

AgentLens: 상용 수준 인터랙티브 코드 에이전트를 위한 트래젝토리 기반 평가 벤치마크

AgentLens는 인터랙티브 코드 에이전트의 전체 실행 경로를 형식적 검증과 LLM이 작성한 실행 리뷰로 평가해 가독성 있는 점수 근거를 제공하는 오픈소스 벤치마크이다.

용어 해설

인터랙티브 코드 에이전트(Interactive Code Agent)
사용자와 상호작용하면서 코드 작성·수정·실행 도구를 호출하는 에이전트로, 단일 결과보다 행동의 연속(도구 사용, 검증, 수정 등)으로 성능을 판단해야 하는 특성이 있다.
형식적 검증(Formal Verification)
명확한 객관적 체크가 가능한 상황에서 자동으로 결과의 정확성을 판별하는 절차로, 코드 생성·수정 작업에서 실행 결과나 명세 기반 조건을 검증하는 데 사용된다.
트래젝토리 평가(Trajectory Evaluation)
작업 수행 과정 전체의 연속적 행동을 평가하는 방법으로, 초기 지시 이행, 도구 호출 패턴, 오류 복구, 자기검증과 같은 중간 단계들을 종합해 성능을 판단하는 접근이다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 07.수집 2026. 07. 10.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.