35B 파라미터, 262K 토큰 문맥으로 7개 에이전트 도메인 시뮬레이션을 지향하는 Language World Model
Qwen-AgentWorld-35B-A3B는 CPT→SFT→RL(GSPO) 파이프라인과 MoE 아키텍처, 262,144 토큰 컨텍스트를 결합해 에이전트 환경의 다음 상태 예측을 목표로 하는 언어 기반 시뮬레이터이며 AgentWorldBench에서 전체 56.39점을 기록했다.
TL;DR
Qwen-AgentWorld-35B-A3B는 Qwen3.5-35B-A3B-Base를 바탕으로 CPT→SFT→RL(GSPO)로 이어지는 3단계 훈련 파이프라인을 적용해 에이전트 행동과 상호작용 히스토리를 입력으로 다음 환경 관측을 예측하도록 설계된 Language World Model이다. 아키텍처는 35B 파라미터(활성화 3B), 256개 전문가 MoE(토큰당 8개 라우팅+1 공유), Gated DeltaNet·Gated Attention 레이어 구성, 그리고 262,144 토큰의 확장 문맥을 결합하여 장문 트래젝토리와 도메인별 전문화를 동시에 다룬다. 모델은 단일 체크포인트로 MCP, Search, Terminal, SWE, Android, Web, OS 등 일곱 도메인을 통합해 처리하며 AgentWorldBench에서 전체 56.39점을 기록해 기반 모델(47.73) 대비 유의미한 개선을 보였다. 서빙 관점에서는 vLLM·SGLang 등 고처리량 인퍼런스 엔진과의 호환성을 제공하나 체크포인트가 언어 가중치만 포함하므로 시각 모듈 초기화를 비활성화해야 하며 대용량 컨텍스트와 MoE 라우팅을 감당할 배포 자원이 필요하다.
핵심 역량
- 모델은 에이전트의 단일 행동과 누적 상호작용 이력을 받아 다음 환경 상태 관측을 텍스트로 생성할 수 있다. 확장된 컨텍스트(최대 262,144 tokens)를 활용하여 장기 대화와 다단계 트래젝토리를 처리할 수 있다. 도메인별 시스템 프롬프트 템플릿을 적용해 도메인 특화 시뮬레이션을 구동할 수 있다.
- 모델은 터미널 명령 실행 결과 예측, 웹/GUI 상호작용 관측 생성, 도구 호출과 그에 따른 상태 변화를 서술하는 시나리오를 생성할 수 있다. thinking mode(`<think>...</think>`)을 통해 내부 Chain-of-Thought 유사의 추론 단계를 거쳐 환경 전이 근거를 형성한다. 샘플링 파라미터와 토큰 길이 조정으로 시뮬레이션 다양성 및 상세도를 제어할 수 있다.
- 모델은 제어 가능한 변형(perturbation)과 허구적 세계 구성(fictional-world construction)을 지원하여 학습 환경에 없는 OOD 시나리오에서도 제너럴라이즈된 관측을 생성할 수 있다. RL 단계에서 시뮬레이션 충실도를 강화해 출력의 일관성과 현실성 지표를 개선하도록 설계되었다. 평가 파이프라인을 통해 포맷·사실성·일관성·현실성·품질 다섯 축으로 출력이 판단된다.
- 서빙 환경에서는 OpenAI 호환 API 형태로 배포 가능하며 vLLM·SGLang 등 고처리량 추론 엔진과 연동된다. 모델 체크포인트는 언어 가중치만 포함하므로 일부 추론 엔진에서는 시각 모듈 초기화를 비활성화해야 정상 동작한다. 권장 샘플링 설정과 도메인별 시스템 프롬프트를 적용하면 시뮬레이션 신뢰도를 높일 수 있다.
강점
- 단일 모델로 일곱 개의 에이전트 상호작용 도메인을 커버하는 통합성이 강점이다. README는 MCP, Search, Terminal, SWE, Android, Web, OS를 모두 하나의 모델로 다룰 수 있음을 명시하여 도메인 전환 비용을 줄이는 설계를 보여준다. 통합 도메인 커버리지는 멀티도메인 시뮬레이션 계열의 일관된 파이프라인을 제공한다.
- 학습 목표를 CPT 단계부터 world modeling에 두어 네이티브한 시뮬레이터 특성을 갖춘 점이 차별적 강점이다. 이 설계는 SFT나 RL을 통한 사후 적응만으로는 얻기 어려운 환경 전이 예측 능력과 제어 가능성을 초기 단계에서 확보하게 한다. 결과적으로 AgentWorldBench에서 기반 모델 대비 전체 점수 개선이 관찰되었다.
- 아키텍처적으로 256개의 전문가와 토큰당 활성화된 8개+1 공유 전문가 구조를 가진 MoE를 채택하여 파라미터 효율성과 문맥별 전문화를 동시에 추구한 점이 장점이다. 더불어 262,144 tokens의 확장 문맥을 통해 장기 트래젝토리와 복합 상호작용을 처리할 수 있도록 설계되었다. 이러한 조합은 대규모 다단계 시뮬레이션에서 실용적 이점을 제공한다.
훈련 방식
모델은 Qwen3.5-35B-A3B-Base를 기반으로 CPT(Continual Pre-Training)으로 환경 지식을 주입하고 SFT로 다음 상태 예측 능력을 활성화한 뒤 RL(GSPO)로 시뮬레이션 충실도를 향상시키는 세 단계 파이프라인을 사용했다. CPT 단계부터 환경 모델링을 학습 목적에 포함시켜 포스트호크 적응이 아닌 네이티브 world modeling 목적을 달성하도록 설계되었다. 학습 데이터로는 README에 명시된 Qwen/AgentWorldBench 등 도메인 특화 데이터셋이 활용되었다.
알아두면 좋은 것
- 모델은 일곱 개의 통합 도메인(MCP, Search, Terminal, SWE, Android, Web, OS)을 단일 모델로 다루며 각 도메인을 위한 domain-specific system prompt 템플릿을 깃허브의 prompts 디렉터리에 제공한다. 이 템플릿들은 시뮬레이터로서 모델을 구동할 때 일관된 관찰 형식과 평가 기준을 유지하도록 설계되었다. 템플릿에는 평가용 judge prompt도 포함되어 있어 에측 산출물의 평가 파이프라인과 직접 연계된다.
- 컨텍스트 길이는 기본 262,144 tokens로 설정되어 있으며 README는 장문 환경 시뮬레이션을 위해 최소 128K 토큰을 유지할 것을 권고한다. 긴 문맥을 활용하면 다단계 트래젝토리와 복합 상호작용을 하나의 시퀀스 안에서 처리할 수 있다. OOM 문제가 발생하면 컨텍스트를 줄이라 권고하나 확장 문맥은 모델의 주된 설계 목표 중 하나임이 명시되어 있다.
- 서빙 예시는 SGLang과 vLLM을 포함하며 vLLM 사용 시 --language-model-only 플래그가 필요하다는 주의가 명시되어 있다. 이 주의는 체크포인트가 언어 가중치만 포함하고 시각 모듈 가중치가 없기 때문에 발생하는 구체적 호환성 문제를 반영한다. 또한 배포 예시에서 텐서 병렬 크기와 최대 모델 길이 설정을 통해 멀티GPU 환경 구성을 보여준다.
- AgentWorldBench라는 자체 벤치마크에서 도메인별 다섯 축(Format, Factuality, Consistency, Realism, Quality) 평균 점수를 보고하며 Qwen-AgentWorld-35B-A3B는 표에서 전체 평균 56.39점을 기록했다. 평가 표는 경쟁 모델들과의 상대 비교를 제공하여 기반 모델 대비 성능 향상 폭을 확인할 수 있도록 구성되었다. 벤치마크와 평가 파이프라인은 github의 eval 스크립트와 연동되어 직접 재현 가능한 절차를 제공한다.
기술적 특징
- 모델은 Mixture of Experts 아키텍처를 도입하여 총 256개 전문가를 보유하고 토큰별로 8개의 라우티드 전문가와 1개의 공유 전문가를 활성화한다. 이 방식은 모든 입력에 대해 전체 전문가를 계산하지 않고 선택적 활성화로 연산 효율을 확보하는 한편 도메인별 특화 기능을 갖추게 한다. 라우팅 메커니즘은 입력 특성에 기반해 전문가를 선택하여 토큰 수준의 동적 전문화를 가능하게 한다.
- 레이어 구성은 Gated DeltaNet와 Gated Attention을 반복적으로 배치한 하이브리드 레이아웃으로 설계되어 있다. Gated DeltaNet은 V용 선형 어텐션 헤드 32개와 QK용 16개의 헤드를 사용하여 계산량과 표상 능력 사이의 균형을 맞추도록 구성되었다. Gated Attention은 Q용 16개 헤드와 KV용 2개 헤드를 사용하며 Rotary Position Embedding 차원을 64로 설정해 장문 위치 정보의 표현을 보조한다.
- 훈련 파이프라인은 세 단계로 구성되어 CPT에서 환경 지식을 주입하고 SFT 단계에서 next-state prediction을 활성화한 뒤 RL(GSPO) 단계로 시뮬레이션 충실도를 강화하도록 설계되었다. CPT 단계에서 모델은 환경 서술과 상호작용 전이를 학습 목표로 삼아 기본 능력을 구축한다. SFT는 감독 신호로 예측 품질을 조정하고 RL은 실질적 현실성·일관성·품질 지표를 개선하는 역할을 한다.
- 컨텍스트 확장은 핵심 설계 요소로서 최대 262,144 tokens를 지원하고 README에서는 최소 권장값으로 128K 토큰 사용을 권고한다. 장문 컨텍스트는 다단계 에이전트 트래젝토리와 누적 상태 변화를 하나의 인풋 시퀀스 안에서 처리할 수 있게 한다. 서빙 시에는 메모리·병렬성 설정을 조정해야 하며 vLLM이나 SGLang 같은 엔진을 통해 고처리량 배포가 가능하다.
차별점
- 환경 모델링을 CPT 단계부터 학습 목적에 포함시켜 '네이티브' world model로 접근한 점이 핵심 차별점이다. 이 설계는 환경 시뮬레이션 능력이 사후 적응된 부가 기능이 아니라 학습 초기 목표로 자리잡도록 만든다. 따라서 SFT와 RL 단계에서의 성능 보정이 보다 직접적으로 시뮬레이션 충실도 향상으로 연결된다.
- 아키텍처 레이어에서 Gated DeltaNet와 Gated Attention을 조합해 어텐션·선형 어텐션의 설계적 이점을 동시 확보한 점이 차별화 요소이다. 이 조합은 헤드 구성과 로테리 포지셔널 설정을 통해 장문 문맥과 세밀한 토큰 상호작용을 동시에 다룰 수 있게 만든다. 결과적으로 장문 시뮬레이션에서의 추론 품질과 연산 효율 사이에 유리한 균형을 제공한다.
- 대규모 MoE(256 experts)와 262K 토큰의 확장 문맥이라는 두 축을 결합해 다도메인 에이전시 시나리오를 처리하도록 설계된 점이 실용적 차별점이다. MoE는 입력별 전문화로 도메인 특화 출력을 유도하고 확장 문맥은 장기 트래젝토리를 하나의 인풋으로 유지하게 한다. 이 조합은 단일 모델로 여러 도메인을 통합하는 목적과 직접적으로 연관된다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AgentWorldBench | Overall (normalized mean across seven domains) | 56.39 | vs Qwen3.5-35B-A3B: +8.66 |
572
Likes
72.4k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.