하니스 트레이닝
하니스 트레이닝은 에이전트 제어 로직(harness)을 특정 task LLM과 환경을 고정한 상태에서 학습시키고, 이후 학습된 harness를 다른 task LLM과 새로운 환경에서 교체해 재사용·평가하는 방법이다. 입력으로는 task 환경과 후보 LLM이 주어지고 출력으로는 baseline 대비 후보의 성능 판단(accept/reject)이 생성된다. 이 접근법은 에이전트 로직과 모델을 분리해 범용성·전이 능력을 확보하려는 목적을 갖는다.