본문으로 건너뛰기

EvoHarness-RL: 장기 LLM 에이전트의 자기진화 하네스

BPE 상태와 비용 인지형 GRPO로 외부 워크스페이스를 학습·조율해 ALFWorld에서 96.9% 성공률을 기록했다.

이 요약은 AI가 원문을 분석해 생성했습니다. 정확한 내용은 원문 기준으로 확인하세요.

TL;DR

긴 지평의 LLM 에이전트는 외부 워크스페이스에 의존하면서 노이즈가 섞인 상호작용 로그와 런타임 접근 제어 문제에 직면한다. EvoHarness-RL은 외부 상태를 BPE(신념·진행·경험)로 구조화하고 감독적 파인튜닝과 비용 인지형 GRPO를 결합해 읽기·갱신·통합 정책을 학습하도록 설계되었다. ALFWorld에서 Qwen3-8B 기반 실험은 96.9% 성공률을 보고했으며, 학습 과정에서 하네스 호출을 모델 내부로 내재화해 호출 빈도를 줄이는 애닐링과 경험 통합으로 상태를 정제하는 진화가 관찰되었다. 이러한 결과는 단순 도구 확장보다 하네스 사용 자체를 학습 가능한 대상으로 삼는 접근이 장기 과제에서 유리함을 시사한다.

섹션별 상세

장기 지평의 LLM 에이전트는 상태 유지, 진행 추적, 도구 호출과 결과 검증, 경험 재사용을 위해 외부 실행 지원(workspace/harness)에 의존하는데, 실제 상호작용 로그는 잡음이 많고 런타임에 외부 상태 접근을 통제하는 문제가 결합되어 복잡성을 높인다. 이 논문은 하네스 사용을 단순한 수작업 규칙이나 프롬프트로 처리하는 대신 정책 수준에서 학습해 온라인 실행 중 상태를 구축하고 갱신하도록 목표를 설정했다. 문제 맥락에서 핵심 난제는 유효한 상태를 생성하는 방법과 비용을 고려한 접근 제어를 동시에 학습하는 데 있다.
EvoHarness-RL은 하네스 상태를 정책 입력으로 노출하는 설계와 두 단계 학습 절차로 구성된다: 첫째, 감독학습 기반의 하네스 파인튜닝으로 기본 에이전트가 하네스 액션 공간과 유용한 외부 상태 구성 방식을 습득한다. 둘째, 비용 인지형 GRPO로 읽기·갱신·통합 같은 런타임 조정 정책을 탐색해 긴 에피소드에서 하네스 호출을 선택적으로 최적화한다. 이 조합은 입력(상호작용 로그)→정책(하네스 액션)→출력(외부 상태 갱신 및 에이전트 행동) 흐름을 연결해 실행 효율과 성공률을 모두 개선하는 방식으로 설계되었다.
하네스 상태로 제안된 BPE는 신념(Belief), 진행(Progress), 경험(Experience)을 통합해 정책이 참조할 수 있는 구조화된 외부 표상을 제공한다. 신념은 관찰에서 추론된 현재 환경·목표 정보, 진행은 작업 단계와 완료 정도를 나타내며 경험은 과거 상호작용에서 유의미한 성공·실패 패턴을 요약해 재사용 가능한 지식으로 보관한다. BPE를 정책 입력으로 사용하면 에이전트가 단순 텍스트 힌트 대신 명시적 상태 요소를 기반으로 언제 외부 상태를 읽고 업데이트할지 결정할 수 있다.
실험은 ALFWorld 환경에서 Qwen3-8B 기반 에이전트에 EvoHarness-RL을 적용해 진행되었고, 보고된 성공률은 96.9%로 표기되어 있다. 학습 파이프라인은 초기의 감독적 파인튜닝으로 하네스 호출 패턴을 모델에 주입한 뒤 GRPO로 비용-혜택을 고려한 호출 정책을 최적화하는 형태였으며, 이 과정에서 하네스 호출 빈도와 외부 상태 크기 변화가 관찰되었다. 결과 수치와 학습 절차가 명확히 제시되어 있어 동일 환경·모델 조건에서 성능 비교가 가능하다.
두 가지 관찰된 역학이 핵심적 영향력을 가진다: 하네스 애닐링(harness annealing)은 반복 학습을 통해 자주 쓰이던 하네스 사용 패턴이 모델 내부 정책에 내재화되어 초기에는 빈번하던 외부 호출이 점차 선택적 접근으로 전환되는 현상이다. 하네스 진화(harness evolution)는 진행 업데이트와 경험 통합을 통해 외부 하네스가 점점 더 컴팩트하고 과제 적응적인 상태 기판으로 정제되는 과정을 가리킨다. 이 두 현상은 단순히 더 큰 메모리나 도구 추가를 넘어서 하네스 사용 자체를 학습 가능한 대상으로 삼는 것이 장기 과제에서 효율과 적응력을 높인다는 실험적 근거를 제공한다.

용어 해설

BPE(신념·진행·경험)(BPE (Belief, Progress, Experience))
하네스 정책의 상태 표현으로 신념(Belief), 진행(Progress), 경험(Experience)을 결합해 런타임에서 읽기·갱신·통합 대상이 되는 외부 상태를 구조화한다. 이 구조는 에이전트 정책이 외부 워크스페이스와 상호작용하는 결정을 내리도록 입력으로 제공된다.
하네스 정책 학습(Harness policy learning)
오프라인으로 하네스 사용 정책을 학습해 온라인 실행 시 외부 워크스페이스를 구성하고 갱신하는 방식으로, 프롬프트·휴리스틱 대신 정책 수준에서 상태 접근을 제어하도록 목표를 설정한다. 학습된 정책은 읽기·업데이트·통합 결정을 포함한다.
비용 인지형 GRPO(Cost-aware GRPO)
하네스와 에이전트의 조정을 위해 설계된 강화학습 변형으로, 외부 상태 접근 및 갱신의 비용을 고려하며 정책을 탐색·최적화해 긴 시간 지평의 상호작용에서 효율적인 하네스 호출 전략을 학습하게 한다.

근거 모음

근거
  • EvoHarness-RL이 ALFWorld에서 Qwen3-8B를 사용해 96.9% 성공률을 달성했다. 초록의 실험 결과 수치(성공률 96.9%)와 실험 환경·모델 명시 출처
  • 하네스 상태를 BPE(신념·진행·경험)로 노출시켜 정책 입력으로 활용했다. 초록에서 BPE를 정책-대상 하네스 상태로 언급 출처
  • 감독적 하네스 파인튜닝과 비용 인지형 GRPO의 결합으로 읽기·업데이트·통합 정책을 학습했다. 초록에 두 단계 학습(감독 파인튜닝 + cost-aware GRPO) 기술 출처
  • 학습 과정에서 하네스 애닐링(내재화로 인한 호출 감소)과 하네스 진화(경험 통합으로 인한 상태 정제)라는 동역학이 관찰되었다. 초록의 두 주요 동역학(harness annealing, harness evolution) 명시 출처

기술

  • Qwen3-8B
  • ALFWorld
  • Supervised fine-tuning
  • Cost-aware GRPO

활용 사례

  • 긴 시간 지평의 작업을 수행하는 LLM 에이전트의 외부 상태 관리
  • 시뮬레이터 기반 상호작용에서 진행 추적과 경험 재사용을 통한 성능 향상
  • 외부 워크스페이스를 비용-효율적으로 호출해야 하는 대화형 시스템
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 11.수집 2026. 08. 11.출처 타입 RSS

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.