본문으로 건너뛰기

Recursive Harness Self-Improvement(RHI)를 통한 하니스 자기개선과 실행 추적 품질 향상

하니스를 프롬프트 수준으로 표현하고 쌍별 피드백으로 반복 개정하는 RHI가 소수 반복으로 실행 추적 품질을 높여 저추론비용 에이전트의 성능을 끌어올리고 추론 비용을 최대 60% 줄였다.

용어 해설

하니스 인 더 루프(Harness-in-the-Loop)
하니스 인 더 루프는 모델 추론 과정에서 실행되는 제어·오케스트레이션 코드나 프롬프트가 단순한 런타임 스캐폴드가 아니라 향후 모델 학습에 쓰일 데이터를 생성하는 구성 요소로 작동하는 개념이다. 이 개념에서는 하니스의 설계와 모델이 상호작용하며 생성된 실행 추적이 다음 세대 모델의 학습 신호로 기능한다. 본문 맥락에서는 하니스를 최적화하면 추론 성능과 학습에 사용되는 추적 품질을 동시에 개선할 수 있음을 전제로 한다.
실행 추적(Execution Trace)
실행 추적은 에이전트 또는 하니스가 수행하는 연속적인 내부 상태·출력·도구 호출의 기록으로, 이후 데이터로 수집되어 모델 재학습에 사용될 수 있다. 이 추적은 질문-응답 흐름, 중간 계산 결과, 도구 사용 로그 등을 포함하며 품질에 따라 학습 신호의 유용성이 달라진다. 논문에서는 실행 추적의 질을 높이는 것이 향후 모델 성능 향상에 결정적 요소로 간주된다.
프롬프트 수준 명세(Prompt-level Specification)
프롬프트 수준 명세는 에이전트 루프의 동작을 텍스트 프롬프트 형태로 구조화하여 하니스의 정책·의사결정 흐름을 표현하는 방식이다. 이 명세는 하니스 내부의 역할 분담, 정보 전달 규칙, 응답 형식 등을 포함하여 하니스 동작을 수정 가능한 텍스트로 캡슐화한다. 본 연구에서는 하니스를 이 명세로 표현한 뒤 반복 개정으로 품질을 개선한다.
쌍별 피드백(Pairwise Feedback)
쌍별 피드백은 서로 다른 하니스 개정안 쌍을 비교하여 어느 쪽이 더 좋은 실행 추적을 생성하는지 판단하는 신호 수집 방식이다. 이 방식은 상대적 선호를 통해 개정 이력을 순위화하거나 학습 신호를 생성하며 소량의 비교만으로도 개선 방향을 포착할 수 있다. 논문에서는 이 피드백을 자기 수정 루프의 핵심 연산으로 사용한다.
정보이론적 목적함수(Information-Theoretic Objective)
정보이론적 목적함수는 하니스 개정이 생성하는 실행 추적의 정보량·처리 효율성·재사용 가능성을 정량화하는 가설적 목표로서, 선택된 개정이 추적의 유용성을 통계적·엔트로피 관점에서 개선하는지를 평가한다. 본문에서는 RHI의 동작이 이와 유사한 암묵적 최적화 목표를 향해 작동한다고 형식화했다. 이 관점은 왜 소수 반복으로도 추적 품질이 오르는지를 설명하는 근거로 활용된다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 07. 17.수집 2026. 07. 21.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.