본문으로 건너뛰기

LLM은 자신의 에이전트 하네스를 만들고 진화시킬 수 있는가

HarnessDev는 LLM이 실행 인프라를 직접 만들고 개선하는 능력을 성능·비용·전이성으로 평가합니다.

용어 해설

에이전트 하네스(Agent Harness)
Agent Harness는 LLM의 출력이 실제 행동으로 이어지도록 실행 루프, 도구 사용 정책, Context 관리, State와 Memory, Lifecycle 제어, 실패 복구, 결과 검증을 묶은 실행 인프라입니다. 같은 모델 가중치라도 하네스 구성에 따라 downstream task 성능과 비용이 달라집니다.
비공개 평가 벤치마크(Held-out Benchmark)
Held-out benchmark는 개발 과정에서 모델이나 하네스 제작자에게 정답과 점수를 공개하지 않고, 개발이 끝난 뒤 일반화 성능을 측정하는 평가 세트입니다. HarnessDev에서는 Evolution 중 보지 못한 630개 SWE-Pro 인스턴스를 사용해 feedback set 과적합 여부를 확인합니다.
실행 모델 전이(Executor Transfer)
Executor transfer는 한 LLM이 만든 하네스를 다른 LLM이 실행할 때 기능과 성능이 유지되는지를 측정하는 관점입니다. 하네스의 Prompt, 도구 프로토콜, 실행 예산, 종료 규칙이 제작 모델에 맞춰져 있으면 실행 모델이 바뀔 때 성능이 크게 떨어질 수 있습니다.
실행 토큰 비용(Execution-Token Cost)
Execution-token cost는 고정된 하네스가 downstream task를 해결하는 동안 실행 모델에 소비한 토큰 수입니다. 제작 과정에서 사용한 토큰은 제외하고, 전체 토큰과 task당 평균 토큰을 따로 계산합니다. 성능뿐 아니라 운영 비용과 처리 효율을 평가하기 위한 지표입니다.
통합 실행 모델 평가(Unified-Eval)
Unified-Eval은 서로 다른 creator LLM이 만든 하네스를 동일한 고정 executor LLM으로 실행하는 평가 방식입니다. Creator와 executor의 능력 및 호환성이 섞이는 Self-Eval과 달리, 하네스 설계 차이를 비교하기 위한 조건을 제공합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 01.수집 2026. 09. 04.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.