TL;DR
언어 모델을 환경 시뮬레이터로 학습하면 실환경 실행 없이 수천 개의 상황을 제어·확장해 에이전트 학습을 가속화할 수 있다. 또한 LWM 학습을 에이전트 사전 단계로 활용하면 downstream 에이전트 성능이 일관되게 향상된다.
왜 중요한가
언어 모델을 환경 시뮬레이터로 학습하면 실환경 실행 없이 수천 개의 상황을 제어·확장해 에이전트 학습을 가속화할 수 있다. 또한 LWM 학습을 에이전트 사전 단계로 활용하면 downstream 에이전트 성능이 일관되게 향상된다.
핵심 기여
대규모 언어 세계 모델 Qwen-AgentWorld 계열 제시
Qwen-AgentWorld-35B-A3B와 Qwen-AgentWorld-397B-A17B를 제시해 MCP, Search, Terminal, SWE, Android, Web, OS의 7개 도메인을 긴 chain-of-thought로 시뮬레이션한다. 학습에 10M+ 환경 상호작용 궤적을 활용했다.
CPT → SFT → RL의 3단계 학습 파이프라인
CPT(continual pre-training)으로 상태 전이·도메인 지식 주입, SFT로 next-state-prediction 사고 패턴 활성화, RL로 시뮬레이션 충실도를 강화하는 단계적 학습 절차를 적용했다. RL에는 GSPO를 사용하고 루브릭·규칙 혼합 보상을 도입했다.
AgentWorldBench: 7개 도메인·2,170 샘플 평가 벤치
실환경에서 얻은 정답 관찰을 바탕으로 구성된 AgentWorldBench를 공개해 Format, Factuality, Consistency, Realism, Quality 5차원 루브릭으로 LWM을 평가한다. MCP는 평균 컨텍스트 59,300 tokens 등 장문 컨텍스트를 포함한다.
환경 시뮬레이터로서의 LWM과 에이전트 기초모델로서의 LWM 검증
LWM을 분리된 시뮬레이터로 사용한 Sim RL은 통제 가능한 대규모 시뮬레이션(예: 4k OpenClaw 환경)을 통해 실환경 학습을 능가하는 이득을 보였고, LWM 사전학습은 Terminal-Bench·SWE-Bench·Claw-Eval 등 downstream 에이전트 벤치 성능을 일괄적으로 향상시켰다.
실용적 학습·평가 기술: loss masking, AutoResearch 프롬프트 최적화, 평가 루브릭
턴 수준 정보이론적 loss masking으로 보일러플레이트 손실을 줄이고, AutoResearch로 시스템 프롬프트 템플릿을 자동 최적화하며, 참조 기반 judge와 규칙 검증기를 결합해 RL 보상과 평가의 안정성을 확보했다.
핵심 아이디어 이해하기
기초 출발점: 언어 모델의 조건부 생성 능력(next-token prediction)은 행동(action)과 과거 관찰(history)을 컨디셔닝하면 환경의 다음 관찰(next observation)을 생성하는 데 직접 사용될 수 있다. 이때 LWM의 입력은 시스템 프롬프트(task context)와 o_{≤t}, a_{≤t}이며 출력은 \hat{o}{t+1}=f{\theta}(c, o_{\le t}, a_{\le t})와 같다. 긴 맥락에 대한 일관된 상태 추적이 요구되므로 단순한 next-token 학습만으로는 사고 패턴이 활성화되기 어렵다.
관련 Figure

각 도메인별 입력·출력 유형(예: accessibility tree, UI view hierarchy, shell output)을 일목요연하게 요약해 통합된 텍스트 표현(schema)을 통해 다양한 관찰 타입을 처리함을 보여준다. 이 그림은 Unified Environment Trajectory Schema의 적용과 도메인 간 일반화 가능성을 직관적으로 보강하므로 core_intuition 및 methodology와 연결된다.
Qwen-AgentWorld의 구성요소(IDE, Terminal, Web, Android, OS, MCP, Search)를 캐릭터 일러스트와 함께 배치한 시스템 인포그래픽.
방법론
전체 접근: 단일 모델이 7개 도메인을 처리하도록 공통의 Unified Environment Trajectory Schema(system_prompt ⊕ [turn_1,…,turn_T])를 채택했다. system_prompt는 task_description, action_space, initial_state, demonstrations, simulation_instruction의 다섯 요소로 구성되어 각 도메인의 상태 전이를 명세한다. 학습은 CPT→SFT→RL 3단계로 진행되며 각 단계에 맞는 데이터와 샘플링 정책을 적용했다. 핵심 메커니즘: (1) 데이터 파이프라인은 전용 에이전트 인프라, 공개 상호작용 로그, 사내 에이전트 궤적으로 구성된다. (2) Trajectory-to-turn expansion으로 각 트래젝토리에서 훈련·평가용 턴 샘플을 생성하되 RL에서는 각 트래젝토리당 정확히 한 턴만 사용해 공유 접두사로 인한 reward collapse를 회피했다. (3) Turn-level 정보이론적 손실 마스킹: 입력으로 행동·관찰의 단어 집합을 추출해 OL, Nov, Jac, R 네 값을 계산한 뒤 통계적 규칙으로 토큰별 손실 반영 비율을 결정해 에코·보일러플레이트 학습을 억제했다. 학습 세부: CPT는 next-token 목표로 환경·전문 지식 코퍼스를 결합해 광범위한 세계 지식을 주입했다. SFT는 reasoning trace를 포함한 샘플을 다중 템플릿으로 노출하고 multi-beam+rejection sampling으로 고품질 레이블을 선별했다(초기 후보 10,250 → 유지 7,094, 유지율 69.2%). RL은 GSPO를 사용하며 보상은 LLM judge의 5차원 루브릭(평균×5, 범위[5,25])과 규칙 기반 verifier(이진 0/1, 스케일 [0,25])를 9:1로 결합했다.
관련 Figure

이 그림은 논문의 전반적 구조를 보여준다: 단일 LWM이 MCP, Search, Terminal, SWE, Android, Web, OS를 아우르며 분리된 시뮬레이터(Decouple) 또는 통합된 에이전트(Unify)로 활용될 수 있음을 시사한다. 연구의 핵심 주장인 '언어 기반 세계 모델이 시뮬레이션과 에이전트 사전학습 역할을 모두 수행'하는 점을 시각적으로 보강하므로 methodology 및 key_contributions와 직접 연결된다.
Qwen-AgentWorld의 개요 다이어그램으로 7개 도메인 통합과 ‘Decouple vs Unify’ 적용 방식을 시각화한다.

GUI 도메인에서 관찰을 픽셀 대신 접근성 트리나 HTML로 표현해 LWM이 직접 다음 화면을 텍스트로 생성하는 작동 방식을 구체적으로 제시한다. 이는 LWM이 시뮬레이션한 관찰을 실제 렌더러로 재현해 에이전트 테스트에 사용 가능한 파이프라인임을 보여주므로 methodology 및 practical_use(시뮬레이터 활용)과 연결된다.
Android 도메인 예시: 사용자가 'Buy Now'를 탭하면 모델이 HTML을 예측하고 렌더러가 다음 상태를 시뮬레이트하는 흐름을 보여준다.
주요 결과
메인 벤치마크: AgentWorldBench(2,170 samples)를 통해 Qwen-AgentWorld 계열이 기존 frontier 모델들을 능가한다고 보고되었다. 평가 프로토콜은 참조 기반 평점(reference-grounded judging)을 사용해 Format, Factuality, Consistency, Realism, Quality의 평균을 0–100으로 환산했다. 심사자 비교 실험에서 서로 다른 judge 모델은 절대 점수 분포는 달랐으나 모델 순위는 높은 상관(ρ=0.92–0.99)을 보였다. Ablation·보상 설계: 단순한 Reference-Reward(이진 A/B)와 Turing-Test 보상은 수렴성이 낮았고, 다차원 루브릭 + 규칙 검증기 조합이 안정적 수렴을 제공했다. RL 학습 과정에서 Factuality가 상대적으로 가장 크게 개선되었고(상대 개선 11.3%)도메인별로 개선 속도는 상이했다. 응용 실험: LWM을 시뮬레이터로 사용한 Sim RL(예: 4k OpenClaw 환경)은 Claw-Eval 및 QwenClawBench 등에서 실환경 학습만으로 얻은 결과를 능가하는 향상을 보였고, LWM으로 사전학습한 모델은 Terminal-Bench 2.0, SWE-Bench Verified/Pro, BFCL v4, Claw-Eval, QwenClawBench, WideSearch 등 7개 에이전트 벤치에서 downstream 성능 증가를 보였다.
관련 Figure

벤치마크의 범위(2,170 samples), 도메인별 컨텍스트 길이(예: MCP 59.3k tokens)와 턴 분포를 제시해 평가가 긴 컨텍스트·다양한 관찰 형식을 포괄함을 보여준다. 이 그림은 평가설계와 결과 해석의 근거 자료로서 results와 evaluation 프로토콜을 직접 보강한다.
AgentWorldBench 구성·통계(도메인 분포, 평균 컨텍스트 길이, 평균 궤적 턴 수)를 요약한 차트 패널.
기술 상세
아키텍처 구조: LWM은 표준 조건부 언어 생성기로, 입력 컨텍스트는 system_prompt와 누적된 (action, observation) 시퀀스이며 출력은 다음 관찰 문자열이다. 수식으로는 \hat{o}{t+1}=f{\theta}(c, o_{\le t}, a_{\le t})이며 학습 목표는 실제 관찰 o_{t+1}의 토큰 시퀀스를 최대우도 방식으로 예측하는 것이다. 정보이론적 마스킹 수치: 각 (action, observation) 쌍에서 W_{act}, W_{obs}를 추출해 OL = |W_{act} ∩ W_{obs}| / |W_{act}| → 관찰이 행동을 얼마나 에코하는지 비율, Nov = |W_{obs} \setminus W_{act}| / |W_{obs}| → 관찰 내 신규 정보 비율, Jac = |W_{act} ∩ W_{obs}| / |W_{act} ∪ W_{obs}| → 집합 유사도, R = |obs| / |act| → 길이비를 계산한다. 이 통계에 따라 7개 카테고리로 분류하고 카테고리별로 손실 반영 비율(예: retrieval 100%, echo 5%)을 적용해 의미 있는 전이만 학습하도록 설계했다. 시스템 프롬프트 자동화: AutoResearch 루프에서 옵티마이저 에이전트가 샘플 궤적과 예측 오류를 분석해 candidate prompt를 제안하고, judge로 평가한 후 반복해 템플릿을 최적화했다. 최종적으로 v0–v11 템플릿을 생성해 CPT/SFT/RL 각 단계에서 서로 다른 템플릿 분포를 사용했다. RL 보상·안정화: 보상은 LLM judge의 5차원 점수(각 1–5) 평균×5와 규칙 기반 verifier의 이진 신호를 9:1로 혼합했다. RL에서의 주요 안정화 기법은(1) RL 풀에서 트래젝토리당 단일 턴만 사용해 접두사 중복으로 인한 reward collapse 회피, (2) self-praise 보상 해킹 방지를 위해 분리된 예측 태그 추출 및 deterministic region의 엄격 매칭, (3) 규칙 기반 보상으로 객관적 앵커 제공 등이다.
한계점
논문 내에서 Factuality가 여전히 가장 낮은 채점 차원으로 남아 있으며(상대 개선 11.3%이지만 절대 점수는 낮음), 환경 시뮬레이션의 정확한 사실 기반 재현은 여전히 가장 어려운 과제로 보고되었다. 또한 LWM RL은 prompt 길이에 비해 출력이 짧아 샘플당 연산이 대부분 컨텍스트 처리에 소요되는 prompt–output 비대칭 문제가 존재한다고 기술되었다.
키워드
용어 해설
- Language World Model
- — 환경의 상태 전이(state transition)를 텍스트 조건부 생성으로 모델링하여 다음 관찰(next observation)을 예측하는 모델. 에이전트의 행동(action)과 과거 관찰을 입력으로 받아 다음 상태를 출력하므로 계획과 시뮬레이션에 직접 사용된다.
- Agentic Trajectory
- — 에이전트의 내부사고(chain-of-thought)와 도구 호출, 환경 관찰이 교차하는 다중 단계 대화형 로그. 환경 궤적(environment trajectory)은 여기서 에이전트 사고를 제거한 (action, observation) 쌍의 연속으로 구성된다.
- Turn-Level Information-Theoretic Loss Masking
- — 관찰이 행동의 단순 에코인지, 실제 새 정보인지 통계(Overlap, Novelty, Jaccard, 길이비 등)로 분류해 일부 토큰을 손실 계산에서 제외하는 기법. 반복적 에코/보일러플레이트로 인한 잡음 성장을 억제해 유의미한 상태 전이만 학습하도록 만든다.
- Hybrid Rubric-and-Rule Rewards
- — LLM 기반 다차원 루브릭(Format, Factuality, Consistency, Realism, Quality) 점수와 실행 가능한 규칙(정확성 검증) 보상을 결합해 RL 보상 신호를 형성하는 방식. 다차원 판단과 객관적 검사로 보상 편향과 해킹을 완화한다.
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.