용어 해설
- Harness 최적화(Harness Optimization)
- — LLM agent의 외부 실행 계층을 개선하는 방법입니다. Prompt, Tool, Middleware의 설정과 제어 로직을 실행 trace에서 얻은 실패 신호로 수정하고, 새 작업군에서도 성능이 유지되는지 검증하는 과정입니다.
- 장기 작업 Agent(Long-Horizon Agent)
- — 여러 단계의 추론과 Tool 사용, 환경 상호작용을 연속적으로 수행하는 Agent입니다. 한 단계의 작은 오류가 이후 결정에 누적되어 전체 작업 실패로 이어질 수 있어 실행 안정성이 중요합니다.
- 실행 Trace(Execution Trace)
- — Agent가 작업을 수행하는 동안 발생한 추론, Tool 호출, 환경 상호작용과 최종 출력을 기록한 데이터입니다. AutoSaddler는 실패 Trace와 Harness 코드를 함께 조사해 수정 원인을 찾습니다.
- Mini-Batch 학습(Mini-Batch Learning)
- — 전체 학습 작업을 작은 묶음으로 나누어 반복적으로 평가하고 업데이트하는 방식입니다. 이 논문에서는 각 Mini-Batch의 실패 Trace로 Patch를 만들고 같은 묶음에서 개선 여부를 확인한 뒤 개발 세트에서 일반화를 평가합니다.
- 일반화 인지 선택(Generalization-Aware Selection)
- — 관찰된 학습 작업만 고치는 업데이트가 아니라 새로운 작업군에서도 성능을 유지하는 Harness 변경을 선택하는 기준입니다. 개발 세트 평가와 Reflection 결과를 사용해 과도하게 넓은 Patch와 회귀를 걸러냅니다.
- Pass@1
- — 각 작업에서 한 번의 실행으로 정답 또는 성공 조건을 통과한 비율입니다. 논문은 세 번 반복 실행한 테스트 결과의 평균과 표준편차를 사용해 Harness별 장기 작업 성공률을 비교합니다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.

