본문으로 건너뛰기

에이전트가 직접 고치는 코딩 하네스 hip-agent

hip-agent가 에이전트 중심의 최소 하네스로 DeepSWE에서 Codex CLI와 비슷한 해결률을 기록했습니다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

기존 코딩 하네스는 사람이 CLI 옵션과 출력 형식을 이해한 뒤 사용하는 구조라서, 다른 에이전트가 Codex 같은 도구를 하위 에이전트로 호출할 때 추가 추론 단계가 필요합니다. hip-agent는 약 200줄의 Python 루프와 Codex API 모듈만으로 구성하고, 에이전트에 sh와 view_image 두 도구만 제공한 뒤 소스 코드를 읽어 하네스의 동작을 파악하게 합니다. 환경 변수는 설정, 셸 명령은 작업, 자식 프로세스는 하위 에이전트로 연결하며 Agent Plugins와 Claude Code hooks, Codex CLI 세션 파일 같은 기존 형식을 활용합니다. DeepSWE 113개 과제에서 hip-agent는 73개를 해결해 64.6%를 기록했고 Codex CLI의 72개·63.7%와 비슷한 성능을 보였지만, 실행은 각각 한 번뿐이고 토큰 사용량은 비교하지 않았습니다. 글은 모델 평가에서 사용자용 하네스의 변화가 모델 성능과 섞이는 문제를 지적하며, 모델 제공자가 작고 수정 가능한 native reference harness를 별도로 제공해야 한다고 결론짓습니다.

섹션별 상세

01
기존 코딩 하네스는 Claude Code나 Codex처럼 사람이 CLI 옵션과 출력 형식을 알고 직접 조작하는 흐름에 맞춰져 있어, 에이전트가 codex exec를 하위 에이전트로 호출하면 플래그를 찾고 결과를 해석하는 데 여러 번의 추가 호출이 필요합니다. hip-agent는 에이전트가 실행 전에 하네스 소스 코드를 읽도록 프롬프트에 지시하고, 핵심 루프를 약 200줄의 Python과 Codex API 모듈 하나로 제한했습니다. 도구를 sh와 view_image 두 개로 줄인 구조는 에이전트가 동작 경계를 빠르게 파악하고 필요할 때 직접 수정하게 하려는 선택입니다.
02
hip-agent는 운영체제를 실행 환경으로 삼아 환경 변수를 설정으로, 셸 명령을 행동으로, 자식 프로세스를 하위 에이전트로 사용합니다. Agent Plugins, Claude Code의 hook contract, Codex CLI 세션 파일 같은 기존 프로토콜과 형식을 결합하므로 별도 구성 계층을 크게 늘리지 않고 플러그인과 재개 가능한 대화를 사용할 수 있습니다. 예를 들어 AGENT_MODEL과 AGENT_PLUGINS를 지정한 뒤 codex login ./agent를 실행하면 모델과 플러그인을 상속한 작업이 시작되고, 하위 에이전트의 세션 상태는 파일에서 읽을 수 있습니다.
bash
# ~/.zshrc
P=~/hip-agent/plugins
export AGENT_MODEL=gpt-5.6-sol
export AGENT_PLUGINS=$P/environment:$P/cwd:$P/agentsmd

codex login ./agent "inspect this repository and explain it"

환경 변수로 사용할 모델과 플러그인 경로를 지정한 뒤 codex login으로 에이전트 작업을 실행합니다.

03
이 구조에서 하네스는 고정된 제품이 아니라 에이전트가 읽고 고칠 수 있는 참조 구현으로 기능합니다. 충분히 강한 모델은 소스 코드로 현재 제약을 파악한 뒤 플러그인을 추가하거나 루프 자체를 수정할 수 있고, 기존 에이전트의 skill에 hip-agent를 넣어 하위 에이전트를 생성할 수도 있습니다. 글은 모델이 좋아질수록 고정 하네스가 병목이 될 수 있으므로 작업에 맞춰 스스로 하네스를 바꾸는 방향을 제시합니다.
04
작성자는 Terminal-Bench 2에서 gpt-5.6-luna를 effort max로 실행하며 셸 설계와 프롬프트를 조금 개선하고 view_image 도구와 명령 시간 제한을 추가했습니다. 이후 최종 코드를 DeepSWE 113개 과제에서 Codex CLI 0.147.0과 비교한 결과 hip-agent는 73/113개, 64.6%를 해결했고 Codex CLI는 72/113개, 63.7%를 해결했습니다. hip-agent의 모델 호출은 과제당 187회, 에이전트 시간은 58분이었고 Codex CLI는 각각 208회와 52분이었으며, 두 실행은 각 한 번이고 하드웨어가 일부 달라 토큰 사용량과 오차 범위는 비교되지 않았습니다.
05
모델 평가에서 하네스는 모델 자체와 분리하기 어려운 변수로 작용합니다. 글은 ARC-AGI-3에서 하네스가 이동 사이의 추론을 잃게 만들었고 Codex의 기본 설정 두 개를 켜자 점수가 세 배가 된 사례, 모델이 같아도 사용자용 하네스 변경으로 결과가 조용히 나빠질 수 있다는 Anthropic의 사후 분석을 근거로 듭니다. 따라서 모델 제공자는 사용자용 제품과 별도로 모델이 세계와 상호작용하도록 학습된 방식을 드러내는 최소 native reference harness를 제공해야 하며, 그러면 기존 에이전트가 새 모델을 하위 에이전트로 쉽게 시험할 수 있습니다.

용어 해설

에이전트 하네스(Agent Harness)
에이전트 하네스는 AI 에이전트가 셸 명령, 하위 에이전트, 세션 상태 같은 실행 환경과 상호작용하도록 연결하는 실행 구조입니다. hip-agent는 이 구조를 약 200줄의 Python 코드와 환경 변수, 셸 명령, 기존 프로토콜로 구성해 에이전트가 직접 읽고 수정할 수 있게 만든 점이 핵심입니다.
하위 에이전트(Subagent)
하위 에이전트는 상위 에이전트가 별도 프로세스로 실행하는 작업 단위입니다. hip-agent에서는 셸에서 agent 명령을 호출하면 환경 변수를 상속한 새 프로세스와 독립 대화 세션이 만들어지고, 기본적으로 상위 에이전트에는 최종 출력만 전달됩니다.
Terminal-Bench 2
Terminal-Bench 2는 터미널 기반 에이전트의 작업 수행 능력을 평가하는 벤치마크입니다. 글에서는 이 평가를 통해 셸 구조, 프롬프트, view_image 도구, 명령 시간 제한을 반복적으로 조정했지만, 최종 결과는 벤치마크에 맞춘 대규모 최적화 없이 사용했습니다.
DeepSWE
DeepSWE는 소프트웨어 엔지니어링 작업을 에이전트가 해결하는지 평가하는 벤치마크입니다. 글에서는 113개 과제에서 hip-agent와 Codex CLI를 각각 한 번씩 실행해 해결 과제 수, 모델 호출 횟수, 에이전트 실행 시간을 비교했습니다.
Codex CLI 세션 파일(Codex CLI session file)
Codex CLI 세션 파일은 대화 상태를 저장해 이후 codex resume 명령으로 작업을 이어가게 하는 형식입니다. hip-agent는 대화 기록을 이 형식으로 남기므로 상위 에이전트가 하위 에이전트의 상태를 직접 읽거나 플러그인으로 더 복잡한 상호작용을 구현할 수 있습니다.

기술

  • Python
  • sh
  • view_image
  • Codex API
  • Agent Plugins
  • Claude Code hook contract
  • Codex CLI session file
  • environment variables

활용 사례

  • 에이전트가 저장소를 검사하고 하위 에이전트에 작업을 위임하는 코딩 작업
  • 기존 에이전트에서 다른 모델을 하위 에이전트로 실행하는 모델 비교
  • 플러그인과 세션 파일을 이용한 사용자 정의 에이전트 루프 구성
  • 모델 성능과 사용자용 하네스를 분리하는 참조 평가 환경

언급된 리소스

AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 09. 08.수집 2026. 09. 09.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.