본문으로 건너뛰기

장기 추론을 돕는 PRO-LONG의 프로그램 메모리

PRO-LONG은 관찰·행동·결과를 log.txt에 쌓고 코드로 검색해 장기 에이전트의 ARC-AGI-3 성능을 높였다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

긴 게임 과제에서는 에이전트가 현재 프롬프트만으로 과거 관찰과 행동 결과를 계속 유지하기 어렵기 때문에, PRO-LONG은 모든 이력을 하나의 구조화된 log.txt에 저장하고 grep·Python 같은 도구로 필요한 부분을 검색하게 한다. 에이전트는 환경에서 observation과 action, outcome을 얻을 때마다 로그를 갱신하고, 다음 행동을 결정할 때 과거 기록 일부를 프로그램적으로 읽어 접근 가능한 컨텍스트를 구성한다. 이 단순한 구조는 별도 subagent나 특수 retrieval 모듈 없이 약 30줄의 system prompt로 구현되며, ARC-AGI-3 공개 게임 세트에서 로그 없는 동일 coding agent보다 평균 18 percentage points 높은 성능과 전문 harness 대비 4.2–5.8배 적은 billed tokens를 기록했다. Fable 5의 best@2는 97.4%, 총 비용은 $1,750였고, 저장소는 전체 로그·최근 25개 구간·로그 없음·workspace 초기화 조건을 비교할 수 있도록 구성됐다.

섹션별 상세

장기 작업을 수행하는 LLM 에이전트는 관찰과 행동이 길게 누적될수록 현재 프롬프트만으로 과거 상태를 유지하기 어렵다. PRO-LONG은 모든 관찰·행동·결과를 하나의 구조화된 log.txt에 계속 기록하고, 에이전트가 grep이나 Python으로 필요한 구간을 직접 검색하게 만든다. 별도의 subagent나 특수 retrieval 모듈 없이 약 30줄의 system prompt와 프로그램 도구만 사용한다는 점에서 메모리 구성을 단순화했다.
PRO-LONG의 LLM Agent, 프로그램 도구 공간, 장기 로그, 환경 사이의 데이터 흐름을 나타낸 아키텍처 다이어그램이다.
Diagram에이전트는 약 100K~1M tokens의 Accessed Context 안에서 작업하지만, 환경의 관찰·행동·결과는 10M+ tokens 규모의 Accessible Context인 log.txt에 구조적으로 누적한다. READ, GREP, BASH를 통해 로그 일부를 조회하고, 환경에서 새로 얻은 결과와 선택한 행동을 다시 WRITE로 기록하는 순환 구조가 핵심이며, 본문이 설명하는 프로그램 메모리의 입력·검색·출력 흐름을 시각적으로 뒷받침한다.
PRO-LONG의 메모리는 에이전트가 환경에서 얻은 observation과 실행한 action, 그 결과를 순서대로 로그에 축적하는 방식으로 작동한다. 이후 에이전트는 READ, GREP, BASH 같은 도구로 log.txt를 조회해 과거 상태와 실패 기록을 현재 판단에 다시 연결한다. 접근 가능한 현재 컨텍스트는 약 100K~1M tokens이고 전체 기록은 10M+ tokens 규모로 분리되어, 긴 게임 이력을 프롬프트에 한꺼번에 넣지 않고 필요할 때만 꺼내 쓴다.
bash
git clone [email protected]:alexisfox7/PRO-LONG.git
cd PRO-LONG
python -m venv .venv
source .venv/bin/activate
pip install -e .
# codex backend
docker build -t prolong-agent/codex-sandbox:latest docker/codex-sandbox
docker build -t prolong-openai-proxy docker/openai-proxy
# claude-code backend
docker build -t prolong-agent/claude-sandbox:latest docker/claude-sandbox
docker build -t prolong-anthropic-proxy docker/anthropic-proxy

PRO-LONG 저장소를 내려받아 Python 가상환경과 패키지를 설치하고 Codex 또는 Claude Code 백엔드용 Docker 이미지를 빌드한다.

bash
prolong-swarm --suite all -m gpt-5.5 --max-actions 500
prolong-swarm --suite all --backend claude-code -m claude-opus-4-6
prolong-swarm --game ls20,ft09 -m gpt-5.5

전체 게임 세트나 개별 게임을 지정하고 모델과 백엔드를 선택해 에이전트 실행을 시작한다.

ARC-AGI-3 공개 게임 전체에서 로그를 사용하는 PRO-LONG은 동일한 coding agent에서 로그를 제거한 조건보다 평균 18 percentage points 높은 성능을 기록했다. 전문화된 harness와 비교해도 billed tokens가 4.2–5.8배 적은 수준에서 성능이 비슷하거나 높았다. Fable 5를 사용한 best@2 평가에서는 97.4%를 기록했고 총 비용은 $1,750이었다.
근거
  • ARC-AGI-3 공개 게임 전체에서 PRO-LONG은 로그가 없는 동일 coding agent보다 평균 18 percentage points 높은 성능을 기록했다. README의 첫 소개 문단에 있는 full ARC-AGI-3 public game set 성능 비교 문장 출처
  • PRO-LONG은 전문화된 harness와 비교해 4.2–5.8배 적은 billed tokens로 성능이 비슷하거나 높았다. README 첫 소개 문단의 specialized harnesses 및 billed tokens 비교 수치 출처
  • Fable 5 실행에서 best@2 성능은 97.4%였고 총 비용은 $1,750이었다. README 첫 소개 문단의 Fable 5 best@2와 total cost 수치 출처
저장소는 메모리 효과를 확인하기 위해 전체 게임 로그, 최근 25개 action section만 허용하는 lw25, 로그 파일 없이 현재 보드를 prompt에 넣는 no-log, 호출마다 workspace를 지우는 stateless 조건을 제공한다. prolong-swarm 명령으로 ARC-AGI-3 전체 세트 또는 개별 게임을 실행하고 --max-actions로 게임당 최대 행동 수를 제한할 수 있다. 실행 결과는 evaluation_results/에 기록되며 공식 online scorecard와 Fable 5의 25회 실행 로그도 저장소에서 확인할 수 있다.
근거
  • 메모리 조건은 전체 로그, 최근 25개 action section, 로그 없음, 호출별 workspace 초기화로 나뉜다. README의 Memory conditions 표와 --log-window, --workspace 플래그 설명 출처

용어 해설

프로그램 메모리(Programmatic Memory)
LLM 에이전트가 과거 정보를 고정된 요약문으로 받는 대신 grep이나 Python 같은 도구로 기록을 직접 검색하는 메모리 방식이다. 긴 작업의 관찰·행동·결과를 필요할 때 조회해 현재 판단에 활용한다.
장기 추론(Long-Horizon Reasoning)
여러 단계의 행동과 피드백을 누적하면서 목표를 해결하는 추론 방식이다. 각 단계의 결과를 이후 판단에 연결해야 하므로 이전 상태와 실패 기록을 안정적으로 보존하고 재사용하는 과정이 중요하다.
절제 조건(Ablation Condition)
시스템의 특정 구성 요소가 성능에 미치는 영향을 확인하기 위해 일부 기능을 제거하거나 제한한 실험 조건이다. PRO-LONG은 전체 로그, 최근 25개 구간, 로그 없음, 작업공간 초기화 조건을 비교한다.
ARC-AGI-3
에이전트가 게임 환경에서 관찰과 행동을 반복하며 문제를 해결하는 평가 세트다. PRO-LONG은 이 공개 게임 세트에서 로그 기반 메모리 유무와 토큰 비용, 반복 실행 성능을 비교했다.
best@2
두 번의 실행 결과 중 더 높은 점수를 성능으로 집계하는 평가 방식이다. 단일 실행의 우연한 실패를 일부 완화하면서 소수 반복 실행에서 시스템이 얻을 수 있는 최고 성능을 측정한다.

기술

  • Python
  • Docker
  • grep
  • Codex CLI
  • Claude Code CLI
  • gpt-5.5
  • claude-opus-4-6
  • ARC-AGI-3

활용 사례

  • ARC-AGI-3 장기 게임 과제
  • 긴 실행 이력을 활용하는 LLM 에이전트
  • 에이전트 메모리 구성의 절제 실험
  • Codex CLI 또는 Claude Code CLI 기반 에이전트 평가
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 17.수집 2026. 08. 17.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.