TL;DR
긴 게임 과제에서는 에이전트가 현재 프롬프트만으로 과거 관찰과 행동 결과를 계속 유지하기 어렵기 때문에, PRO-LONG은 모든 이력을 하나의 구조화된 log.txt에 저장하고 grep·Python 같은 도구로 필요한 부분을 검색하게 한다. 에이전트는 환경에서 observation과 action, outcome을 얻을 때마다 로그를 갱신하고, 다음 행동을 결정할 때 과거 기록 일부를 프로그램적으로 읽어 접근 가능한 컨텍스트를 구성한다. 이 단순한 구조는 별도 subagent나 특수 retrieval 모듈 없이 약 30줄의 system prompt로 구현되며, ARC-AGI-3 공개 게임 세트에서 로그 없는 동일 coding agent보다 평균 18 percentage points 높은 성능과 전문 harness 대비 4.2–5.8배 적은 billed tokens를 기록했다. Fable 5의 best@2는 97.4%, 총 비용은 $1,750였고, 저장소는 전체 로그·최근 25개 구간·로그 없음·workspace 초기화 조건을 비교할 수 있도록 구성됐다.
섹션별 상세

git clone [email protected]:alexisfox7/PRO-LONG.git
cd PRO-LONG
python -m venv .venv
source .venv/bin/activate
pip install -e .
# codex backend
docker build -t prolong-agent/codex-sandbox:latest docker/codex-sandbox
docker build -t prolong-openai-proxy docker/openai-proxy
# claude-code backend
docker build -t prolong-agent/claude-sandbox:latest docker/claude-sandbox
docker build -t prolong-anthropic-proxy docker/anthropic-proxyPRO-LONG 저장소를 내려받아 Python 가상환경과 패키지를 설치하고 Codex 또는 Claude Code 백엔드용 Docker 이미지를 빌드한다.
prolong-swarm --suite all -m gpt-5.5 --max-actions 500
prolong-swarm --suite all --backend claude-code -m claude-opus-4-6
prolong-swarm --game ls20,ft09 -m gpt-5.5전체 게임 세트나 개별 게임을 지정하고 모델과 백엔드를 선택해 에이전트 실행을 시작한다.
- ARC-AGI-3 공개 게임 전체에서 PRO-LONG은 로그가 없는 동일 coding agent보다 평균 18 percentage points 높은 성능을 기록했다. — README의 첫 소개 문단에 있는 full ARC-AGI-3 public game set 성능 비교 문장 출처
- PRO-LONG은 전문화된 harness와 비교해 4.2–5.8배 적은 billed tokens로 성능이 비슷하거나 높았다. — README 첫 소개 문단의 specialized harnesses 및 billed tokens 비교 수치 출처
- Fable 5 실행에서 best@2 성능은 97.4%였고 총 비용은 $1,750이었다. — README 첫 소개 문단의 Fable 5 best@2와 total cost 수치 출처
- 메모리 조건은 전체 로그, 최근 25개 action section, 로그 없음, 호출별 workspace 초기화로 나뉜다. — README의 Memory conditions 표와 --log-window, --workspace 플래그 설명 출처
용어 해설
- 프로그램 메모리(Programmatic Memory)
- — LLM 에이전트가 과거 정보를 고정된 요약문으로 받는 대신 grep이나 Python 같은 도구로 기록을 직접 검색하는 메모리 방식이다. 긴 작업의 관찰·행동·결과를 필요할 때 조회해 현재 판단에 활용한다.
- 장기 추론(Long-Horizon Reasoning)
- — 여러 단계의 행동과 피드백을 누적하면서 목표를 해결하는 추론 방식이다. 각 단계의 결과를 이후 판단에 연결해야 하므로 이전 상태와 실패 기록을 안정적으로 보존하고 재사용하는 과정이 중요하다.
- 절제 조건(Ablation Condition)
- — 시스템의 특정 구성 요소가 성능에 미치는 영향을 확인하기 위해 일부 기능을 제거하거나 제한한 실험 조건이다. PRO-LONG은 전체 로그, 최근 25개 구간, 로그 없음, 작업공간 초기화 조건을 비교한다.
- ARC-AGI-3
- — 에이전트가 게임 환경에서 관찰과 행동을 반복하며 문제를 해결하는 평가 세트다. PRO-LONG은 이 공개 게임 세트에서 로그 기반 메모리 유무와 토큰 비용, 반복 실행 성능을 비교했다.
- best@2
- — 두 번의 실행 결과 중 더 높은 점수를 성능으로 집계하는 평가 방식이다. 단일 실행의 우연한 실패를 일부 완화하면서 소수 반복 실행에서 시스템이 얻을 수 있는 최고 성능을 측정한다.
기술
- Python
- Docker
- grep
- Codex CLI
- Claude Code CLI
- gpt-5.5
- claude-opus-4-6
- ARC-AGI-3
활용 사례
- ARC-AGI-3 장기 게임 과제
- 긴 실행 이력을 활용하는 LLM 에이전트
- 에이전트 메모리 구성의 절제 실험
- Codex CLI 또는 Claude Code CLI 기반 에이전트 평가
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
