본문으로 건너뛰기

실행 Trace로 LLM Agent Harness를 자동 개선

AutoSaddler는 실패 Trace를 깊게 진단하고 Prompt·Tool·Middleware를 표적 수정해 LLM Agent Harness를 일반화 가능하게 개선합니다.

용어 해설

Harness 최적화(Harness Optimization)
LLM agent의 외부 실행 계층을 개선하는 방법입니다. Prompt, Tool, Middleware의 설정과 제어 로직을 실행 trace에서 얻은 실패 신호로 수정하고, 새 작업군에서도 성능이 유지되는지 검증하는 과정입니다.
장기 작업 Agent(Long-Horizon Agent)
여러 단계의 추론과 Tool 사용, 환경 상호작용을 연속적으로 수행하는 Agent입니다. 한 단계의 작은 오류가 이후 결정에 누적되어 전체 작업 실패로 이어질 수 있어 실행 안정성이 중요합니다.
실행 Trace(Execution Trace)
Agent가 작업을 수행하는 동안 발생한 추론, Tool 호출, 환경 상호작용과 최종 출력을 기록한 데이터입니다. AutoSaddler는 실패 Trace와 Harness 코드를 함께 조사해 수정 원인을 찾습니다.
Mini-Batch 학습(Mini-Batch Learning)
전체 학습 작업을 작은 묶음으로 나누어 반복적으로 평가하고 업데이트하는 방식입니다. 이 논문에서는 각 Mini-Batch의 실패 Trace로 Patch를 만들고 같은 묶음에서 개선 여부를 확인한 뒤 개발 세트에서 일반화를 평가합니다.
일반화 인지 선택(Generalization-Aware Selection)
관찰된 학습 작업만 고치는 업데이트가 아니라 새로운 작업군에서도 성능을 유지하는 Harness 변경을 선택하는 기준입니다. 개발 세트 평가와 Reflection 결과를 사용해 과도하게 넓은 Patch와 회귀를 걸러냅니다.
Pass@1
각 작업에서 한 번의 실행으로 정답 또는 성공 조건을 통과한 비율입니다. 논문은 세 번 반복 실행한 테스트 결과의 평균과 표준편차를 사용해 Harness별 장기 작업 성공률을 비교합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 24.수집 2026. 08. 27.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.