7개 도메인 통합 환경 시뮬레이터, AgentWorldBench 전체 56.39 점
Qwen-AgentWorld-35B-A3B는 CPT→SFT→RL 파이프라인으로 학습된 네이티브 언어 기반 월드 모델로 262,144 토큰 컨텍스트와 MoE 구조를 활용해 에이전트의 행동에서 다음 환경 상태를 예측한다.
TL;DR
Qwen-AgentWorld-35B-A3B는 Qwen3.5-35B-A3B를 기반으로 CPT→SFT→RL(GSPO) 파이프라인으로 학습된 네이티브 언어 월드 모델로, 에이전트의 행동과 상호작용 기록으로부터 다음 환경 관찰을 생성하는 것을 학습 목표로 삼았다. 아키텍처는 40개 레이어와 Gated DeltaNet·Gated Attention 블록을 결합하고 256개의 전문가를 가진 MoE를 통해 입력별로 8개의 전문가를 활성화하며 기본 컨텍스트 길이는 262,144 토큰이다. AgentWorldBench 평가에서 전체 56.39점을 기록해 동일 계열의 Qwen3.5-35B-A3B보다 전체 성능이 향상되었고 MCP·SWE·OS 도메인에서 강점을 보였다. 배포 관점에서는 Transformers, vLLM, SGLang 같은 추론 프레임워크와 호환되며 제공된 시스템 프롬프트와 권장 샘플링 매개변수로 멀티턴 환경 시뮬레이션을 운영할 수 있다. 단점으로는 대형 MoE와 확장 컨텍스트를 운영하기 위한 인프라 요구와 실제 배포 시 메모리·시간 비용이 증가할 가능성이 존재한다, 이러한 트레이드오프는 README의 배포 권장 사항과 컨텍스트 길이 권고를 통해 명시되어 있다.
핵심 역량
- 모델은 에이전트의 액션과 이전 상호작용을 받아 다음 환경 관찰을 자연어로 생성할 수 있다. 이 과정에서 장기 체인오브소트(reasoning) 형식을 사용해 상태 전이의 중간 추론 단계를 내부적으로 유지한다. 생성 결과는 환경 포맷과 사실성, 일관성, 현실감, 품질 같은 다차원 평가지표로 평가 가능하다.
- 한 모델로 MCP(tool calling), Search, Terminal, SWE, Android, Web, OS 등 일곱 도메인을 처리할 수 있다. 각 도메인용 시스템 프롬프트 템플릿을 제공하여 도메인별 시뮬레이션 제어와 평가 설정을 통일한다. 도메인별 입력은 텍스트와 GUI 상호작용 로그를 모두 포함할 수 있다.
- 확장 컨텍스트를 활용해 수만 토큰에 걸친 멀티턴 궤적을 유지하면서 상태 누적 정보를 반영한 예측을 수행한다. 기본 컨텍스트 길이는 262,144 토큰으로 긴 관찰과 복합 작업 시 시뮬레이션 일관성을 확보한다. 권장 설정은 최소 128K 토큰 이상을 유지하는 것이다.
- 제로샷으로 도메인 외 환경에 대한 일반화와 가상 환경 생성, 통제된 섭동(fictional-world construction)을 지원한다. 훈련 과정에서 가공된 가상 환경을 활용해 OOD 환경에서도 동작하는 범용성을 확보했다는 주장이 README에 포함되어 있다. 이로 인해 현실 훈련 환경 데이터에 의존하지 않는 확장성이 가능하다.
강점
- AgentWorldBench 전체 점수 56.39를 기록해 동일 계열의 Qwen3.5-35B-A3B 기준 47.73보다 유의한 성능 향상을 보였다. README의 비교 표는 도메인별 세부 점수까지 제시하여 특정 도메인에서의 우위를 정량적으로 확인할 수 있게 한다. 특히 MCP와 SWE, OS 도메인에서 상대적 강점이 드러난다.
- 아키텍처 측면에서 MoE 구성과 Gated DeltaNet 및 Gated Attention 블록의 결합으로 대규모 용량을 효율적으로 운영할 수 있다. 256개의 전문가와 입력별 8개 활성화 전략은 표현력 확대와 연산 비용 절충을 동시에 달성하는 설계 선택이다. 이러한 구조는 긴 컨텍스트를 요구하는 환경 시뮬레이션에 유리하게 작용한다.
- 배포 호환성과 라이선스 측면에서 Transformers, vLLM, SGLang 등 주요 추론 프레임워크와 호환되며 Apache-2.0 라이선스를 채택해 상업적 활용과 배포에 유연성을 제공한다. README에 포함된 배포 예시는 실제 운영에서 필요한 텐서 병렬, 컨텍스트 길이 설정 등 실무적 고려사항을 반영하고 있다. 이로 인해 실전 도입 장벽이 상대적으로 낮다.
훈련 방식
기반 모델은 Qwen3.5-35B-A3B이며 학습은 CPT로 환경 지식을 주입한 뒤 SFT로 다음 상태 예측 능력을 활성화하고 GSPO 기반 RL로 시뮬레이션 충실도를 연마하는 3단계 파이프라인을 거쳤다. CPT 단계부터 환경 모델링을 학습 목표로 설정하여 사후 적응이 아닌 네이티브 월드 모델 특성을 부여했다. 학습 데이터로는 Qwen/AgentWorldBench와 관련 도메인별 시뮬레이션 데이터가 사용된 것으로 표기되어 있다.
알아두면 좋은 것
- 모델은 CPT에서 환경 지식을 주입하고 이어서 SFT로 다음 상태 예측을 활성화한 뒤 RL(GSPO)로 시뮬레이션 정확도를 연마하는 세 단계 학습 파이프라인을 거쳤다. 이 파이프라인 설계로 환경 모델링이 사후적 부가물이 아니라 학습 목표로 설정되었다. 파이프라인 중 RL 단계는 시뮬레이션 충실도 향상에 초점을 맞추었다.
- 아키텍처는 40개 레이어와 10×(3×(Gated DeltaNet → MoE) → 1×(Gated Attention → MoE)) 형태의 히든 레이아웃을 사용하며 MoE는 전체 256개의 전문가 중 입력별로 8개의 전문가를 라우팅해 활성화한다. 헤드 구성과 로테리 포지셔널 차원, 전문가 중간 차원 등 구체 수치가 명시되어 아키텍처 용량과 효율 전략을 드러낸다. 활성 파라미터는 총 35B이지만 실제로는 3B가 활성화된다고 기술되어 있다.
- AgentWorldBench 평가에서 모델은 전체 평균 56.39점을 기록해 동일 계열의 Qwen3.5-35B-A3B 기준보다 높은 성능을 나타냈다. 성능 표에는 도메인별 점수와 여러 경쟁 모델의 비교가 포함되어 있어 도메인별 강점과 약점을 파악할 수 있다. MCP, SWE, OS 도메인에서 특히 강한 점수를 보였다.
- 모델은 Transformers, vLLM, SGLang 등 일반적인 추론 프레임워크와 호환되며 SGLang과 vLLM 예시 명령을 통해 OpenAI 호환 API로 배포할 수 있도록 안내하고 있다. 배포 예시는 텐서 병렬 설정과 확장 컨텍스트 파라미터를 포함해 실환경 운영 시 고려할 설정을 명확히 제시한다. 라이선스는 Apache-2.0이다.
기술적 특징
- 모델은 CPT에서 환경 지식을 주입한 다음 SFT로 다음 상태 예측을 활성화하고 RL(GSPO)로 시뮬레이션 충실도를 연마하는 3단계 학습 파이프라인을 사용했다. 이 파이프라인은 환경 모델링을 학습 목적의 핵심으로 설정하여 사후 적응 방식과 구별된다. 그 결과 모델은 단일 체계 내에서 환경 시뮬레이션 능력을 직접 학습한 네이티브 월드 모델로 설계되었다.
- 아키텍처는 40개 레이어와 특화된 히든 레이아웃을 채택했으며 Gated DeltaNet과 Gated Attention을 교차 배치해 표현 변환과 어텐션 연산을 분리했다. Gated DeltaNet은 선형 어텐션 헤드 구성으로 긴 시퀀스 처리 비용을 낮추도록 설계되었으며 Gated Attention은 전통적 어텐션 형식으로 정밀한 상호토큰 관계를 유지한다. 이러한 블록 레벨 설계는 장기 기억과 국부적 세부 정보 모두를 처리하려는 균형 전략을 반영한다.
- Mixture of Experts 구조는 총 256개의 전문가를 두고 입력별로 8개의 전문가를 라우팅하여 활성화함으로써 모델 용량을 확장하면서 추론 시 활성 파라미터를 제한하는 방식으로 동작한다. 전문가 중간 차원과 공유 전문가 구성을 통해 전문가 간 지식 공유와 스페셜라이제이션을 조절한다. 이로 인해 전체 파라미터 수는 크지만 실제 활성화되는 계산량은 제어되어 대형 모델의 실무적 운영이 용이해진다.
- 확장 컨텍스트 전략은 기본 262,144 토큰의 컨텍스트 창을 통해 긴 멀티턴 환경 궤적을 유지하면서 상태 전이를 연속적으로 예측할 수 있게 한다. README는 최소 128K 토큰 유지 권장을 명시해 대화형 또는 시뮬레이션 작업에서 컨텍스트 축소가 성능 영향을 미칠 수 있음을 명시한다. 확장 컨텍스트는 환경 상태 누적과 복합 추론을 가능하게 하는 핵심 설계 요소다.
- 모델은 툴 호출과 도메인별 상호작용을 통합하기 위해 도메인별 시스템 프롬프트 템플릿을 제공하고 있으며 이러한 프롬프트는 시뮬레이션 제어와 평가 일관성 확보에 기여한다. 프롬프트 템플릿은 각 도메인별 입출력 포맷과 채점 지침을 표준화하여 모델 응답의 포맷 및 품질 평가를 용이하게 한다. 이를 통해 동일한 모델로 다양한 에이전트ic 작업 흐름을 재현하고 비교 가능하게 했다.
차별점
- 이 모델은 CPT 단계부터 환경 모델링을 학습 목표로 설정하여 '네이티브 월드 모델' 특성을 갖는다. 대부분의 다른 접근은 사후적으로 환경 시뮬레이터를 적응시키는 반면 이 모델은 처음부터 다음 상태 예측을 최우선 과제로 학습했다. 그 결과 시뮬레이션 충실도와 제어 가능한 가상 환경 생성 능력에서 차별성을 확보했다.
- 한 개 모델로 MCP, Search, Terminal, SWE, Android, Web, OS 총 일곱 도메인을 통합해 도메인 간 전이 학습과 단일 아키텍처 기반의 멀티도메인 시뮬레이션을 실현했다. 도메인별 시스템 프롬프트와 평가 템플릿을 제공해 도메인 간 일관된 시뮬레이션 파이프라인을 운영할 수 있다. 이로 인해 도메인 확장과 OOD 일반화에서 실용적 이점이 발생한다.
- 아키텍처 차원에서는 대규모 MoE와 Gated DeltaNet·Gated Attention의 조합, 그리고 262,144 토큰의 대형 컨텍스트를 동시에 채택해 장기 추론과 전문가 기반 용량 확장을 병행했다. MoE는 256개 전문가와 8개 활성화 규칙을 통해 높은 표현력을 제공하면서 계산 비용을 제어한다. 확장 컨텍스트는 복합한 환경 상태 추적과 긴 체인 오브 소트를 가능하게 해 시뮬레이션 정확도 향상에 기여한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AgentWorldBench | Overall | 56.39 | vs Qwen3.5-35B-A3B: 47.73 |
145
Likes
315.9k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.