본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

unsloth/Qwen-AgentWorld-35B-A3B-GGUF

에이전트 행동과 상호작용 기록을 입력으로 받아 텍스트 기반 및 GUI 포함 환경의 다음 상태 관찰을 생성하는 텍스트 생성 기반 환경 시뮬레이션과 에이전트 시뮬레이션35B (3B activated)256K 컨텍스트apache-2.0

Qwen-AgentWorld-35B-A3B는 CPT→SFT→RL 파이프라인으로 학습된 네이티브 언어 기반 월드 모델로 262,144 토큰 컨텍스트와 MoE 구조를 활용해 에이전트의 행동에서 다음 환경 상태를 예측한다.

학습 방식 · 기반 모델은 Qwen3.5-35B-A3B이며 학습은 CPT로 환경 지식을 주입한 뒤 SFT로 다음 상태 예측 능력을 활성화하고 GSPO 기반 RL로 시뮬레이션 충실도를 연마하는 3단계 파이프라인을 거쳤다. CPT 단계부터 환경 모델링을 학습 목표로 설정하여 사후 적응이 아닌 네이티브 월드 모델 특성을 부여했다. 학습 데이터로는 Qwen/AgentWorldBench와 관련 도메인별 시뮬레이션 데이터가 사용된 것으로 표기되어 있다.

TL;DR

Qwen-AgentWorld-35B-A3B는 Qwen3.5-35B-A3B를 기반으로 CPT→SFT→RL(GSPO) 파이프라인으로 학습된 네이티브 언어 월드 모델로, 에이전트의 행동과 상호작용 기록으로부터 다음 환경 관찰을 생성하는 것을 학습 목표로 삼았다. 아키텍처는 40개 레이어와 Gated DeltaNet·Gated Attention 블록을 결합하고 256개의 전문가를 가진 MoE를 통해 입력별로 8개의 전문가를 활성화하며 기본 컨텍스트 길이는 262,144 토큰이다. AgentWorldBench 평가에서 전체 56.39점을 기록해 동일 계열의 Qwen3.5-35B-A3B보다 전체 성능이 향상되었고 MCP·SWE·OS 도메인에서 강점을 보였다. 배포 관점에서는 Transformers, vLLM, SGLang 같은 추론 프레임워크와 호환되며 제공된 시스템 프롬프트와 권장 샘플링 매개변수로 멀티턴 환경 시뮬레이션을 운영할 수 있다. 단점으로는 대형 MoE와 확장 컨텍스트를 운영하기 위한 인프라 요구와 실제 배포 시 메모리·시간 비용이 증가할 가능성이 존재한다, 이러한 트레이드오프는 README의 배포 권장 사항과 컨텍스트 길이 권고를 통해 명시되어 있다.

핵심 포인트

  • 이 모델은 CPT 단계부터 환경 모델링을 학습 목표로 설정하여 '네이티브 월드 모델' 특성을 갖는다. 대부분의 다른 접근은 사후적으로 환경 시뮬레이터를 적응시키는 반면 이 모델은 처음부터 다음 상태 예측을 최우선 과제로 학습했다. 그 결과 시뮬레이션 충실도와 제어 가능한 가상 환경 생성 능력에서 차별성을 확보했다.
  • 한 개 모델로 MCP, Search, Terminal, SWE, Android, Web, OS 총 일곱 도메인을 통합해 도메인 간 전이 학습과 단일 아키텍처 기반의 멀티도메인 시뮬레이션을 실현했다. 도메인별 시스템 프롬프트와 평가 템플릿을 제공해 도메인 간 일관된 시뮬레이션 파이프라인을 운영할 수 있다. 이로 인해 도메인 확장과 OOD 일반화에서 실용적 이점이 발생한다.
  • 아키텍처 차원에서는 대규모 MoE와 Gated DeltaNet·Gated Attention의 조합, 그리고 262,144 토큰의 대형 컨텍스트를 동시에 채택해 장기 추론과 전문가 기반 용량 확장을 병행했다. MoE는 256개 전문가와 8개 활성화 규칙을 통해 높은 표현력을 제공하면서 계산 비용을 제어한다. 확장 컨텍스트는 복합한 환경 상태 추적과 긴 체인 오브 소트를 가능하게 해 시뮬레이션 정확도 향상에 기여한다.
  • AgentWorldBench 전체 점수 56.39를 기록해 동일 계열의 Qwen3.5-35B-A3B 기준 47.73보다 유의한 성능 향상을 보였다. README의 비교 표는 도메인별 세부 점수까지 제시하여 특정 도메인에서의 우위를 정량적으로 확인할 수 있게 한다. 특히 MCP와 SWE, OS 도메인에서 상대적 강점이 드러난다.

벤치마크

벤치마크지표비교
AgentWorldBenchOverall56.39vs Qwen3.5-35B-A3B: 47.73

145

LIKES

315.9k

DOWNLOADS

4 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.