TL;DR
AI가 다른 AI 에이전트의 코딩 하네스를 개선하는 능력을 측정하기 위해 HarnessOpt-Bench가 설계됐으며, 보류 데이터와 최종 평가기를 최적화 샌드박스 밖에 둬 시험 해답을 훔치는 경로를 차단했습니다. 5개 Frontier 모델과 4개 작업을 대상으로 한 111회 실행에서 Claude Opus 5와 OpenCode 조합이 4개 작업 중 3개에서 가장 높은 결과를 냈습니다. 하네스만 바꾼 비교에서는 OpenCode가 20개 모델·작업 조합 중 11개에서 native harness보다 앞섰지만, 모델이 자기 전용 하네스에서 일관되게 우세한 현상은 없었습니다. 모델 선택의 성능 영향은 하네스 선택보다 1.8배 컸습니다.
주요 논점
격리된 평가 서버와 외부 권한 통제를 사용하면 AI가 다른 AI의 코딩 하네스를 개선하는 능력을 시험 해답을 훔치는 방식과 분리해 측정할 수 있습니다. 111회 실행과 작업별 비교 결과는 모델 선택과 하네스 선택이 성능에 미치는 상대적 영향을 구체적으로 비교할 근거를 제공합니다.
실험 결과는 OpenCode가 20개 모델·작업 조합 중 11개에서 native harness보다 앞섰다는 점을 보여주지만, 모든 모델에 동일한 전용 하네스 우위가 있다는 결론으로 이어지지는 않습니다. 모델 선택의 영향이 하네스 선택보다 1.8배 컸다는 결과도 특정 벤치마크와 작업 구성 안에서 나온 비교입니다.
합의점 vs 논쟁점
합의점
- 최적화 에이전트가 보류 데이터와 최종 평가기에 접근하지 못하도록 평가 체계를 외부에 두는 것이 핵심 조건입니다.
- 실험에서는 모델 선택이 코딩 하네스 선택보다 성능 향상에 더 큰 영향을 미쳤습니다.
- OpenCode는 비교된 20개 모델·작업 조합 중 11개에서 native harness보다 높은 결과를 냈습니다.
논쟁점
- OpenCode의 우위가 특정 작업과 벤치마크 설계에 한정된 결과인지, 더 넓은 코딩 작업에서도 유지되는지는 이 글만으로 판단하기 어렵습니다.
- 모델이 자기 전용 하네스에서 일관되게 더 잘 작동하지 않는다는 결과가 모든 모델과 하네스 조합에 일반화되는지는 추가 검증이 필요합니다.
실용적 조언
- 재귀적 AI 최적화 실험에서는 시험 데이터와 최종 평가기를 최적화 루프 밖의 신뢰된 서버에 두어야 합니다. 개발 단계의 상세 추적과 검증 단계의 집계 점수, 테스트 단계의 무점수 조건을 분리하면 최적화 대상이 평가 신호를 역으로 이용하는 경로를 줄일 수 있습니다. API 키와 예산 통제도 샌드박스 내부에 전달하지 않고 외부 권한 계층에서 집행해야 합니다.
- 코딩 에이전트 성능을 비교할 때 모델을 고정하고 하네스만 바꾸는 실험과 하네스를 고정하고 모델만 바꾸는 실험을 따로 구성해야 합니다. 원문처럼 모델·작업 조합별 결과를 기록하면 평균 점수 하나만으로는 보이지 않는 조합별 차이를 확인할 수 있습니다. 모델 선택의 효과가 하네스 선택보다 1.8배였다는 결과처럼 두 요인의 영향 크기도 함께 산출해야 합니다.
섹션별 상세
용어 해설
- 재귀적 자기 개선(Recursive Self-Improvement)
- — AI 시스템이 다른 AI 에이전트의 실행 구조나 도구 사용 방식을 자동으로 수정해 성능을 높이는 접근입니다. 개선 대상의 평가 결과를 다시 최적화 과정에 입력한다는 점에서 일반적인 모델 추론이나 단순 Fine-tuning과 구별됩니다.
- 코딩 하네스(Coding Harness)
- — 코딩 에이전트가 작업을 수행하도록 연결된 실행 환경과 도구 사용 절차의 묶음입니다. 모델 자체를 바꾸지 않고 파일 접근, 명령 실행, 반복 방식 같은 하네스를 조정하면 동일 모델의 작업 성능이 달라질 수 있습니다.
- 보류 평가기(Held-out Evaluator)
- — 최적화 과정에 직접 노출되지 않은 별도의 평가 시스템입니다. 최적화 대상이 시험 데이터나 점수 계산 절차를 읽고 답을 맞히는 일을 막기 위해 평가 데이터와 권한 통제를 외부에 둡니다.
- 개선 여지(Headroom)
- — 현재 성능과 가능한 최고 성능 사이에 남아 있는 상승 폭을 뜻합니다. 원문에서는 모델 버전이 특정 작업에서 기존 개선 여지의 몇 퍼센트를 확보했는지 비교하는 지표로 사용됩니다.
- 샌드박스 격리(Sandbox Isolation)
- — 최적화 에이전트가 API 키, 예산 제어 장치, 보류 데이터, 최종 평가기를 직접 볼 수 없도록 실행 환경을 분리하는 방식입니다. 접근 금지를 지시문에만 의존하지 않고 권한 구조와 평가 서버의 위치로 강제합니다.
언급된 도구
코딩 에이전트가 작업을 수행하는 coding harness로 사용되었으며, Claude Opus 5를 포함한 여러 모델과 조합해 성능을 비교했습니다.
OpenCode와 비교된 native harness 중 하나입니다.
OpenCode와 비교된 native harness 중 하나입니다.
OpenCode와 비교된 native harness 중 하나입니다.
언급된 리소스
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.