본문으로 건너뛰기

AI가 다른 AI의 코딩 성능을 개선하는가

HarnessOpt-Bench는 AI가 코딩 하네스를 개선하는 능력과 평가 조작을 막는 조건을 함께 측정합니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

AI가 다른 AI 에이전트의 코딩 하네스를 개선하는 능력을 측정하기 위해 HarnessOpt-Bench가 설계됐으며, 보류 데이터와 최종 평가기를 최적화 샌드박스 밖에 둬 시험 해답을 훔치는 경로를 차단했습니다. 5개 Frontier 모델과 4개 작업을 대상으로 한 111회 실행에서 Claude Opus 5와 OpenCode 조합이 4개 작업 중 3개에서 가장 높은 결과를 냈습니다. 하네스만 바꾼 비교에서는 OpenCode가 20개 모델·작업 조합 중 11개에서 native harness보다 앞섰지만, 모델이 자기 전용 하네스에서 일관되게 우세한 현상은 없었습니다. 모델 선택의 성능 영향은 하네스 선택보다 1.8배 컸습니다.

주요 논점

01찬성다수

격리된 평가 서버와 외부 권한 통제를 사용하면 AI가 다른 AI의 코딩 하네스를 개선하는 능력을 시험 해답을 훔치는 방식과 분리해 측정할 수 있습니다. 111회 실행과 작업별 비교 결과는 모델 선택과 하네스 선택이 성능에 미치는 상대적 영향을 구체적으로 비교할 근거를 제공합니다.

02중립분열

실험 결과는 OpenCode가 20개 모델·작업 조합 중 11개에서 native harness보다 앞섰다는 점을 보여주지만, 모든 모델에 동일한 전용 하네스 우위가 있다는 결론으로 이어지지는 않습니다. 모델 선택의 영향이 하네스 선택보다 1.8배 컸다는 결과도 특정 벤치마크와 작업 구성 안에서 나온 비교입니다.

합의점 vs 논쟁점

합의점

  • 최적화 에이전트가 보류 데이터와 최종 평가기에 접근하지 못하도록 평가 체계를 외부에 두는 것이 핵심 조건입니다.
  • 실험에서는 모델 선택이 코딩 하네스 선택보다 성능 향상에 더 큰 영향을 미쳤습니다.
  • OpenCode는 비교된 20개 모델·작업 조합 중 11개에서 native harness보다 높은 결과를 냈습니다.

논쟁점

  • OpenCode의 우위가 특정 작업과 벤치마크 설계에 한정된 결과인지, 더 넓은 코딩 작업에서도 유지되는지는 이 글만으로 판단하기 어렵습니다.
  • 모델이 자기 전용 하네스에서 일관되게 더 잘 작동하지 않는다는 결과가 모든 모델과 하네스 조합에 일반화되는지는 추가 검증이 필요합니다.

실용적 조언

  • 재귀적 AI 최적화 실험에서는 시험 데이터와 최종 평가기를 최적화 루프 밖의 신뢰된 서버에 두어야 합니다. 개발 단계의 상세 추적과 검증 단계의 집계 점수, 테스트 단계의 무점수 조건을 분리하면 최적화 대상이 평가 신호를 역으로 이용하는 경로를 줄일 수 있습니다. API 키와 예산 통제도 샌드박스 내부에 전달하지 않고 외부 권한 계층에서 집행해야 합니다.
  • 코딩 에이전트 성능을 비교할 때 모델을 고정하고 하네스만 바꾸는 실험과 하네스를 고정하고 모델만 바꾸는 실험을 따로 구성해야 합니다. 원문처럼 모델·작업 조합별 결과를 기록하면 평균 점수 하나만으로는 보이지 않는 조합별 차이를 확인할 수 있습니다. 모델 선택의 효과가 하네스 선택보다 1.8배였다는 결과처럼 두 요인의 영향 크기도 함께 산출해야 합니다.

섹션별 상세

01
이 글은 AI가 다른 AI 에이전트의 코딩 하네스를 개선할 수 있는지, 그리고 최적화 과정이 평가를 속이지 못하게 하려면 무엇이 필요한지를 측정하는 HarnessOpt-Bench를 소개합니다. 개발 단계에서는 최적화 모델이 사례별 실행 추적을 보지만, 검증 단계에서는 전체 점수 하나만 받고 테스트 단계에서는 최종 하네스가 신뢰된 서버에서 평가될 때까지 점수를 받지 않습니다. API 키, 예산 통제, 보류 데이터, 평가기는 최적화 샌드박스 밖에 배치되어 시험 해답을 직접 읽거나 평가 절차를 조작하는 경로를 차단합니다. 이 설계는 지시문을 따르라는 약속이 아니라 권한과 평가 위치를 분리하는 구조에 근거하므로 재귀적 자기 개선의 측정 조건을 더 엄격하게 만듭니다.
02
5개 Frontier 모델과 4개 downstream task를 대상으로 111회 실행해 두 가지 가설을 검사했습니다. 동일한 코딩 하네스에서 모델만 바꾼 실험에서는 Claude Opus 5를 OpenCode와 결합한 구성이 4개 작업 중 3개에서 가장 높은 결과를 냈습니다. 2025년 11월부터 2026년 7월까지 한 작업의 출시 버전을 비교하면 GPT는 개선 여지의 3%에서 49%로, Claude Opus는 37%에서 59%로 상승했습니다. 모델 버전과 선택이 실제 성능 향상을 크게 바꿀 수 있다는 결과입니다.
03
동일 모델에서 코딩 하네스만 바꾼 실험은 모델이 자기 회사나 자기 계열의 하네스에서 일관되게 더 잘 작동한다는 근거를 찾지 못했습니다. OpenCode는 Claude Code, Codex, Kimi CLI 같은 native harness와 비교한 20개 모델·작업 조합 중 11개에서 더 높은 결과를 냈습니다. 모델 선택이 만든 성능 향상 폭은 하네스 선택보다 1.8배 컸습니다. 따라서 특정 모델에 맞춘 전용 하네스라는 직관보다 모델 자체의 선택과 버전이 더 큰 변수일 수 있습니다.

용어 해설

재귀적 자기 개선(Recursive Self-Improvement)
AI 시스템이 다른 AI 에이전트의 실행 구조나 도구 사용 방식을 자동으로 수정해 성능을 높이는 접근입니다. 개선 대상의 평가 결과를 다시 최적화 과정에 입력한다는 점에서 일반적인 모델 추론이나 단순 Fine-tuning과 구별됩니다.
코딩 하네스(Coding Harness)
코딩 에이전트가 작업을 수행하도록 연결된 실행 환경과 도구 사용 절차의 묶음입니다. 모델 자체를 바꾸지 않고 파일 접근, 명령 실행, 반복 방식 같은 하네스를 조정하면 동일 모델의 작업 성능이 달라질 수 있습니다.
보류 평가기(Held-out Evaluator)
최적화 과정에 직접 노출되지 않은 별도의 평가 시스템입니다. 최적화 대상이 시험 데이터나 점수 계산 절차를 읽고 답을 맞히는 일을 막기 위해 평가 데이터와 권한 통제를 외부에 둡니다.
개선 여지(Headroom)
현재 성능과 가능한 최고 성능 사이에 남아 있는 상승 폭을 뜻합니다. 원문에서는 모델 버전이 특정 작업에서 기존 개선 여지의 몇 퍼센트를 확보했는지 비교하는 지표로 사용됩니다.
샌드박스 격리(Sandbox Isolation)
최적화 에이전트가 API 키, 예산 제어 장치, 보류 데이터, 최종 평가기를 직접 볼 수 없도록 실행 환경을 분리하는 방식입니다. 접근 금지를 지시문에만 의존하지 않고 권한 구조와 평가 서버의 위치로 강제합니다.

언급된 도구

OpenCode추천

코딩 에이전트가 작업을 수행하는 coding harness로 사용되었으며, Claude Opus 5를 포함한 여러 모델과 조합해 성능을 비교했습니다.

Claude Code중립

OpenCode와 비교된 native harness 중 하나입니다.

Codex중립

OpenCode와 비교된 native harness 중 하나입니다.

Kimi CLI중립

OpenCode와 비교된 native harness 중 하나입니다.

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 28.수집 2026. 08. 28.출처 타입 REDDIT

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.