본문으로 건너뛰기
HF Daily Papers조회 1

LongCLI-Bench: 명령줄 인터페이스에서의 장기적 에이전트 프로그래밍을 위한 예비 벤치마크 및 연구

기존 코딩 벤치마크의 한계인 데이터 오염과 짧은 작업 범위를 극복하고, 실제 소프트웨어 개발 환경과 유사한 복잡한 장기 과제 수행 능력을 정밀하게 측정한다. 실험을 통해 현재 에이전트의 병목이 실행력보다 전략적 계획 수립에 있음을 밝히고 인간-에이전트 협업의 중요성을 제시한다.

용어 해설

명령줄 인터페이스(CLI)
사용자가 텍스트 명령어를 입력하여 컴퓨터 시스템과 상호작용하는 방식이다. 에이전트는 터미널을 통해 파일을 수정하고 도구를 실행하며 환경 피드백을 받아 다음 행동을 결정한다. 실제 소프트웨어 엔지니어링 작업이 이루어지는 핵심 환경이다.
장기 과제(Long-horizon Task)
수십 단계 이상의 복잡한 계획과 실행이 필요한 작업을 의미한다. 이전 단계의 결과가 다음 단계의 성공에 영향을 미치는 순차적 의존성이 강하며, 에이전트가 긴 시간 동안 문맥을 유지하고 일관된 목표를 추구해야 하므로 난이도가 매우 높다.
회귀 테스트(Regression Testing)
새로운 코드를 추가하거나 수정했을 때 기존에 잘 작동하던 기능이 망가지지 않았는지 확인하는 절차이다. 에이전트가 새로운 요구사항을 구현하면서 기존 시스템의 무결성을 파괴하는지 감시하는 중요한 품질 관리 수단이다.
F2P/P2P 테스트(F2P/P2P Testing)
에이전트의 수정을 검증하는 이중 프로토콜이다. F2P(Fail→Pass)는 실패하던 초기 상태에서 요구사항 구현 후 성공으로 바뀌었는지 확인하고, P2P(Pass→Pass)는 성공하던 기존 기능들이 수정 후에도 여전히 성공하는지 확인하여 안정성을 평가한다.
단계별 점수화(Step-level Scoring)
전체 작업의 성공 여부만 따지는 이진 평가와 달리, 작업의 세부 단계를 나누어 각각 점수를 매기는 방식이다. 에이전트가 과제의 어느 지점까지 도달했는지, 어느 단계에서 주로 실패가 발생하는지 정밀하게 분석할 수 있게 해준다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 02. 16.수집 2026. 02. 26.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.