TL;DR
에이전트 개발에서 평가는 고전적 머신러닝의 학습 데이터와 같은 역할을 수행하며 시스템 개선을 위한 핵심 신호가 된다. Better-Harness는 에이전트를 감싸는 프롬프트와 도구 정의인 '하네스'를 평가 지표에 기반해 자율적으로 개선하는 복합 시스템 아키텍처이다. 이 시스템은 프로덕션 트레이스에서 평가 사례를 추출하고, 최적화 세트와 홀드아웃 세트를 분리하여 과적합을 방지하며 성능을 높인다. 실제 테스트 결과 Claude Sonnet과 GLM-5 모델 모두에서 도구 사용 및 후속 질문 품질이 크게 향상됨이 확인됐다.
배경
LLM 에이전트 아키텍처에 대한 이해, 프롬프트 엔지니어링 및 도구 사용(Tool Use) 개념, LangSmith와 같은 트레이싱 도구 사용 경험
대상 독자
프로덕션 환경에서 LLM 에이전트의 성능과 신뢰성을 높이고자 하는 AI 엔지니어 및 제품 관리자
의미 / 영향
이 방법론은 에이전트 개발을 단순한 프롬프트 엔지니어링에서 데이터 중심의 체계적인 공학 프로세스로 전환시킨다. 특히 자율적인 최적화 루프를 통해 개발자의 수동 개입을 줄이면서도 홀드아웃 세트와 인간 리뷰를 통해 안전성을 확보할 수 있다는 점에서 실무적 가치가 크다.
섹션별 상세

Model Phase Optimization Tool Use | Optimization Followup | Holdout Tool Use | Holdout Followup
Claude-sonnet-4-6 Before 1/2 | 0/3 | 7/8 | 2/6
After 2/2 | 2/3 | 7/8 | 6/6Claude Sonnet 모델을 사용한 하네스 최적화 전후의 성능 비교 데이터

- Claude Sonnet 4.6 모델은 하네스 최적화 후 홀드아웃 세트의 후속 질문 품질 점수가 2/6에서 6/6으로 상승했다. — Results from the Better-Harness loop 섹션의 실험 결과 표
- GLM-5 모델은 최적화 루프를 통해 도구 사용 최적화 점수가 0/2에서 2/2로 개선되었다. — Results from the Better-Harness loop 섹션의 실험 결과 표
용어 해설
- Harness
- — 에이전트가 도구를 사용하고 추론하며 환경과 상호작용할 수 있도록 감싸는 프롬프트, 도구 정의, 제어 로직의 집합체이다. 에이전트의 성능을 결정짓는 핵심적인 시스템 레이어로 작용한다.
- Hill Climbing
- — 현재 상태보다 더 나은 인접 상태로 계속 이동하여 최적의 해를 찾아가는 최적화 기법이다. 에이전트 개발에서는 평가 지표를 높이기 위해 하네스를 반복적으로 수정하는 과정을 의미한다.
- Holdout Set
- — 최적화 과정에서 사용하지 않고 최종 검증을 위해 따로 떼어둔 데이터셋이다. 에이전트가 특정 평가 사례에만 과적합되지 않고 새로운 상황에서도 잘 작동하는지 일반화 성능을 측정하는 데 필수적이다.
- Reward Hacking
- — 에이전트가 실제 의도된 목표를 달성하기보다 평가 시스템의 허점을 이용해 점수만 높이려는 현상이다. 과적합된 프롬프트로 인해 점수는 오르지만 실제 성능은 떨어지는 부작용을 포함한다.
기술
- LangChain
- LangSmith
- Claude Sonnet
- GLM-5
활용 사례
- 에이전트 성능 자동 최적화
- 프로덕션 실패 사례 기반 평가 데이터셋 구축
- 에이전트 회귀 테스트 자동화
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.