TL;DR
긴 지평의 LLM 에이전트는 외부 워크스페이스에 의존하면서 노이즈가 섞인 상호작용 로그와 런타임 접근 제어 문제에 직면한다. EvoHarness-RL은 외부 상태를 BPE(신념·진행·경험)로 구조화하고 감독적 파인튜닝과 비용 인지형 GRPO를 결합해 읽기·갱신·통합 정책을 학습하도록 설계되었다. ALFWorld에서 Qwen3-8B 기반 실험은 96.9% 성공률을 보고했으며, 학습 과정에서 하네스 호출을 모델 내부로 내재화해 호출 빈도를 줄이는 애닐링과 경험 통합으로 상태를 정제하는 진화가 관찰되었다. 이러한 결과는 단순 도구 확장보다 하네스 사용 자체를 학습 가능한 대상으로 삼는 접근이 장기 과제에서 유리함을 시사한다.
섹션별 상세
용어 해설
- BPE(신념·진행·경험)(BPE (Belief, Progress, Experience))
- — 하네스 정책의 상태 표현으로 신념(Belief), 진행(Progress), 경험(Experience)을 결합해 런타임에서 읽기·갱신·통합 대상이 되는 외부 상태를 구조화한다. 이 구조는 에이전트 정책이 외부 워크스페이스와 상호작용하는 결정을 내리도록 입력으로 제공된다.
- 하네스 정책 학습(Harness policy learning)
- — 오프라인으로 하네스 사용 정책을 학습해 온라인 실행 시 외부 워크스페이스를 구성하고 갱신하는 방식으로, 프롬프트·휴리스틱 대신 정책 수준에서 상태 접근을 제어하도록 목표를 설정한다. 학습된 정책은 읽기·업데이트·통합 결정을 포함한다.
- 비용 인지형 GRPO(Cost-aware GRPO)
- — 하네스와 에이전트의 조정을 위해 설계된 강화학습 변형으로, 외부 상태 접근 및 갱신의 비용을 고려하며 정책을 탐색·최적화해 긴 시간 지평의 상호작용에서 효율적인 하네스 호출 전략을 학습하게 한다.
근거 모음
- EvoHarness-RL이 ALFWorld에서 Qwen3-8B를 사용해 96.9% 성공률을 달성했다. — 초록의 실험 결과 수치(성공률 96.9%)와 실험 환경·모델 명시 출처
- 하네스 상태를 BPE(신념·진행·경험)로 노출시켜 정책 입력으로 활용했다. — 초록에서 BPE를 정책-대상 하네스 상태로 언급 출처
- 감독적 하네스 파인튜닝과 비용 인지형 GRPO의 결합으로 읽기·업데이트·통합 정책을 학습했다. — 초록에 두 단계 학습(감독 파인튜닝 + cost-aware GRPO) 기술 출처
- 학습 과정에서 하네스 애닐링(내재화로 인한 호출 감소)과 하네스 진화(경험 통합으로 인한 상태 정제)라는 동역학이 관찰되었다. — 초록의 두 주요 동역학(harness annealing, harness evolution) 명시 출처
기술
- Qwen3-8B
- ALFWorld
- Supervised fine-tuning
- Cost-aware GRPO
활용 사례
- 긴 시간 지평의 작업을 수행하는 LLM 에이전트의 외부 상태 관리
- 시뮬레이터 기반 상호작용에서 진행 추적과 경험 재사용을 통한 성능 향상
- 외부 워크스페이스를 비용-효율적으로 호출해야 하는 대화형 시스템
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.
