본문으로 건너뛰기
HF Daily Papers조회 1

EnvACE: World Rehearsal로 환경 동역학 내재화

정책이 행동과 환경 반응을 번갈아 생성해 환경 동역학을 파라미터로 내재화하는 agentic RL 방법

왜 중요한가

장기간 도구 사용을 요구하는 LLM 에이전트 학습은 외부 실행 가능한 환경이나 정확한 시뮬레이터에 크게 의존하며, 이들 구성과 검증 비용이 학습 확장성을 제한합니다. EnvACE는 정책이 행동과 환경 반응을 번갈아 생성하도록 학습해 환경 동역학을 정책 파라미터로 내재화하고, 그 결과 외부 환경 접근 없이도 환경-반응 관계를 학습하고 전이 가능성을 높입니다. 이 접근은 학습 시 외부 환경 구축 부담을 줄이고, 테스트 시에는 사전 리허설을 통해 실행 비용과 위험을 낮출 수 있으므로 실제 도구-연동 에이전트 개발의 확장성에 실질적 의미를 제공합니다.

핵심 기여

World Rehearsal 도입

World Rehearsal은 정책이 한 번의 타임스텝에서 먼저 행동을 생성한 뒤 같은 정책이 그 행동에 대한 환경적 응답을 생성하도록 역할을 바꾸는 메커니즘입니다. 이 과정으로 생성된 응답은 즉시 히스토리에 추가되어 이후 행동이 자체적으로 생성한 관찰을 조건으로 하게 됩니다. 따라서 환경 모델링을 별도 시뮬레이터가 아닌 정책 파라미터에 흡수시켜 학습 과정에서 행동과 응답의 인과관계를 직접 내재화합니다.

EnvACE 학습 프레임워크

EnvACE는 acting과 rehearsal 두 역할을 하나의 공유 정책으로 번갈아 수행하며 온폴리시 궤적을 내부적으로 전개합니다. 두 역할의 출력에 대해 역할별 보상 기준을 적용하는 role-wise GRPO로 혜택을 분리해 안정적으로 파라미터를 공동 업데이트합니다. 이 설계는 행동 결정 능력과 환경 예측 능력을 동시에 길러 전이 성능과 샘플 효율을 개선하는 방향으로 작동합니다.

Role-wise GRPO 최적화

EnvACE는 각 역할(Act, Rehearse)마다 별도의 보상 기준 μ_{x,r}을 계산해 동일 궤적 내부의 출력에 역할별 advantage를 부여합니다. 역할별 baseline으로 보정된 advantage를 GRPO의 클리핑된 목적함수로 최적화하여 토큰 수준의 likelihood ratio로 파라미터를 업데이트합니다. 이 방법은 동시학습에서 역할 간 신호 간섭을 줄이며 역할 특화 기여도를 균형 있게 반영합니다.

테스트 시 private rehearsal 및 메모리

학습된 정책은 테스트 단계에서 외부 환경에 커밋하기 전에 N번의 사적 리허설을 수행해 각 시도에서 생성된 상상 궤적과 자체 피드백을 수집합니다. 병렬 모드와 순차 모드를 제공해 독립적 시도 또는 이전 시도의 평가를 반영한 반복 개선을 지원하고, 모든 시도는 리허설 메모리로 요약되어 최종 실행의 조건으로 사용됩니다. 이 과정은 추가 외부 상호작용 없이 후보 행동을 비교하고 위험을 줄이는 수단으로 작동합니다.

핵심 아이디어 이해하기

기존 에이전트 학습은 정책이 행동을 생산하고 외부 환경이나 시뮬레이터가 그에 대한 관찰을 반환하는 경계를 전제로 합니다. EnvACE는 이 경계를 없애고 동일 정책이 행동을 생성한 뒤 즉시 그 행동에 대한 환경 반응을 생성하도록 역할을 전환하여 행동과 응답 생성 과정을 정책 내부로 통합합니다. 그 결과 반복적 리허설을 통해 행동→관찰의 인과관계가 파라미터에 내재화되어, 정책이 행동을 선택할 때 자신이 예측한 환경 반응을 조건으로 삼아 더 일반화된 의사결정을 할 수 있게 됩니다.

방법론

문제는 도구 호출을 포함하는 POMDP 설정에서 시작하며, 정책 πθ는 히스토리 ht를 입력으로 Act 역할에서 행동 at을 생성합니다. 그 다음 Rehearse 역할에서 같은 정책이 조건(ht, at)으로 가상의 관찰 ôt를 생성하고 이를 히스토리에 추가해 ht+1을 형성합니다. 학습은 그룹별 온폴리시 샘플링(K개의 롤아웃)과 역할별 baseline μ_{x,r}을 이용한 GRPO 클리핑 목적함수로 진행되며, 각 롤아웃의 전체 보상 R(τ)로 토큰 수준 likelihood ratio를 통해 파라미터를 공동 업데이트합니다.

주요 결과

저자들은 BFCL-v4, τ²-Bench, VitaBench, FinMCP-Bench를 포함한 여러 agentic 벤치마크에서 EnvACE가 외부 환경 스케일링 기반의 강한 베이스라인을 능가한다고 보고합니다. 통제 실험에서는 학습 중 acting과 rehearsal를 공동 최적화하는 것이 모델 규모 전반에 걸쳐 정책 학습을 일관되게 향상시킨다는 경향이 관찰됩니다. 또한 테스트 시 제한된 리허설 예산을 할당하면 실제 실행 전에 후보 행동을 비교·선택해 추가적인 성능 개선을 얻을 수 있습니다.

기술 상세

EnvACE는 단일 공유 정책 πθ가 Act와 Rehearse 두 역할을 교대로 수행하도록 설계되어 입력 히스토리와 생성된 행동을 받아 가상의 관찰을 생성하고 이를 히스토리에 누적합니다. 학습은 각 instruction에 대해 K개의 롤아웃을 샘플링하고, 롤아웃 내 모든 출력에 대해 역할별 집합 G_{x,r}을 구성하여 역할별 평균 보상 μ_{x,r}으로 advantage A_{i,m}=R_i−μ_{x,r_{i,m}}를 계산합니다. 최적화는 토큰 수준 likelihood ratio를 사용하는 클리핑된 GRPO 목적함수로 이루어지며, 테스트 시에는 병렬 또는 순차 리허설을 통해 N개의 상상 궤적과 그 피드백을 리허설 메모리 m_x로 요약해 최종 실행에 조건으로 제공합니다.

실무 활용

EnvACE는 외부 실행 가능한 환경 구축 비용이나 시뮬레이터 검증 부담을 줄이고자 하는 환경에서 실용적입니다. 정책 내부에 환경 반응 모델을 내재화하면 데이터 수집과 검증에 드는 자원을 절감하면서도 도구-연동 작업의 장기적 의사결정 능력을 향상시킬 수 있습니다. 테스트 단계의 사적 리허설은 위험한 실제 실행을 줄이고 비용-효율적으로 후보 행동을 비교하는 데 유용합니다.

  • 웹 탐색·API 호출처럼 도구 사용이 잦고 환경 구축이 어려운 시나리오에서 정책 학습
  • 금융·의료 등 외부 상호작용 비용이나 규제가 높은 도메인에서 사적 리허설로 실행 전 검증
  • 대규모 벤치마크에서 외부 시뮬레이터 없이 에이전트 성능을 빠르게 평가하고 개선

코드 공개 여부: 공개

코드 저장소 보기

키워드

world rehearsalEnvACEGRPOAgentic Reinforcement LearningPOMDP리허설 메모리

추가 이미지 분석

Figure 1은 기존의 실환경 롤아웃, 외부 시뮬레이터 롤아웃과 EnvACE의 world rehearsal를 비교한 도식입니다.
Diagram

그림은 왼쪽에서 외부 환경이 행동에 대해 응답을 반환하는 전통적 흐름을, 중앙에서 별도 LLM 시뮬레이터가 응답을 생성하는 경우를 그리고 오른쪽에서 정책 자체가 행동 후 환경 응답을 생성해 히스토리에 추가하는 EnvACE의 act–rehearse 루프를 시각적으로 대비합니다. 이 비교는 핵심적으로 응답 생성 주체를 외부에서 정책 내부로 옮기는 설계 차이를 직관적으로 전달하며, 논문 본문에서 설명한 역할별 학습의 동기를 보조하는 시각 근거로 사용됩니다.

Figure 1은 기존의 실환경 롤아웃, 외부 시뮬레이터 롤아웃과 EnvACE의 world rehearsal를 비교한 도식입니다.

두 번째 그림은 EnvACE 전체 파이프라인 개요로, 지침부터 행동·도구 호출·리허설 응답·역사 업데이트·역할별 GRPO와 테스트-타임 스케일링 흐름을 보여줍니다.
Diagram

파이프라인 도식은 Act와 Rehearse의 순환, 역할별 GRPO 최적화에서의 그룹 샘플링, 그리고 테스트 시 병렬·순차 리허설과 리허설 메모리 생성 과정을 단계별로 구성해 보여줍니다. 특히 오른쪽 하단의 테스트-타임 스케일링 부분은 private rehearsal과 single roll execution의 차이를 명확히 하여 학습 시 외부 환경 의존성 감소와 테스트 시의 리허설 활용을 연결하는 구현적 세부를 보완합니다.

두 번째 그림은 EnvACE 전체 파이프라인 개요로, 지침부터 행동·도구 호출·리허설 응답·역사 업데이트·역할별 GRPO와 테스트-타임 스케일링 흐름을 보여줍니다.

용어 해설

부분 관찰 마르코프 의사결정과정(POMDP)
부분 관찰 마르코프 의사결정과정(POMDP)은 에이전트가 환경 상태를 직접 관찰하지 못하고 관찰(observation)을 통해 간접 정보를 얻는 문제 설정입니다. 입력으로 상호작용 기록과 도구 호출을 받고 내부 상태는 확률적 전이 P에 의해 갱신됩니다. 이 논문은 도구 호출에 따른 관찰 생성 과정을 정책 내부로 옮겨 학습하는 맥락에서 POMDP의 관찰 생성 함의를 중심으로 다룹니다.
에이전트용 세계 모델(World Model)
세계 모델은 에이전트 행동이 환경 상태와 관찰에 미치는 인과관계를 예측하는 함수적 모듈입니다. 보통 별도의 모델이나 시뮬레이터로 구현하여 lookahead나 planning에 사용하며, 입력으로 행동을 받고 출력으로 예상 관찰을 생성합니다. EnvACE는 이 기능을 별도 모듈이 아닌 정책 파라미터 내부에 내재화하여 acting과 modeling을 동일한 네트워크가 수행하도록 설계합니다.
LLM 기반 시뮬레이터(LLM-based Simulator)
LLM 기반 시뮬레이터는 언어 모델을 이용해 도구 출력이나 사용자 응답 같은 환경 반응을 생성하는 외부 모듈입니다. 비용은 상대적으로 낮지만 생성 품질이나 일관성, 그리고 외부 환경과의 접지(grounding) 문제가 남아 있습니다. 본 논문은 이러한 외부 시뮬레이터 의존도를 줄이기 위해 정책 자체가 반응을 생성하도록 설계합니다.
온폴리시 궤적(On-policy Trajectory)
온폴리시 궤적은 학습 중인 정책 πθ로 생성된 행동-관찰 연속이며, 각 궤적은 최종 보상으로 평가됩니다. 입력으로 현재 히스토리 ht를 받아 행동을 출력하고, 이후 관찰을 얻어 히스토리를 갱신하는 과정을 반복합니다. EnvACE는 이 온폴리시 과정에서 관찰을 외부에서 받는 대신 정책이 스스로 생성하도록 바꿔 궤적을 내부적으로 전개합니다.
리허설 메모리(Rehearsal Memory)
리허설 메모리는 테스트 시 여러 상상 궤적과 그에 대한 자기평가를 압축해 보관한 요약 정보입니다. 병렬 또는 순차 리허설에서 생성된 궤적과 피드백을 통합하여 최종 확정 행동을 위한 조건으로 사용합니다. 이 메모리는 외부 환경에 영향을 주지 않는 사적 시뮬레이션 결과를 행동 선택에 반영하는 매개체 역할을 합니다.
AI 분석 전체 내용 보기

AI 요약 · 북마크 · 개인 피드 설정 — 무료

출처 · 인용 안내

원문 발행 2026. 08. 06.수집 2026. 08. 08.출처 타입 PAPER

인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.