XYZAILab/XYZ-Aquila-pro
장기 웹 탐색과 다중 소스 근거 검증을 수행하는 딥 서치 전용 에이전틱 사고 모델(397B-A17B)397B-A17B262K 컨텍스트apache-2.0
400B 미만 오픈 웨이트 딥 서치 모델 중 최고 점수를 내며 일부 대형 비공개 모델에도 근접한 397B 검색 에이전트
학습 방식 · Qwen3.5-397B-A17B를 바탕으로 AI4AI라는 bounded-exploration 파이프라인(사람이 목표·제약·위험경계를 정의하고 AI 에이전트가 실패를 진단해 개입을 제안)으로 데이터·후처리·런타임 전반을 최적화했다.
TL;DR
XYZ-Aquila-pro는 Qwen3.5-397B-A17B를 같은 AI4AI 파이프라인으로 딥 서치 전용 후처리한 사고 모델로, BrowseComp 84.8·DeepSearchQA 92.5·HLE 53.3 등 평가한 6개 벤치마크 전 항목에서 400B 미만 오픈 웨이트 모델 중 최고 점수를 기록했다. Claude Opus 4.7(HLE 54.7)이나 Kimi-K2.6(DeepSearchQA 92.5) 같은 훨씬 크거나 비공개인 프런티어 모델과도 근접하거나 동률인 점수를 낸다. mini와 마찬가지로 장기 계획, 영중 웹 브라우징, 다중 소스 근거 취합, 출처 검증에 최적화됐으며 AxisAgentic 하니스가 실제 도구 실행과 재현 가능한 평가 워크플로를 제공한다. 더 큰 베이스 모델의 여유를 활용해 최상위권 딥 서치 성능을 오픈 웨이트로 확보하려는 조직에 적합하다.
핵심 포인트
- Qwen3.5-397B-A17B를 딥 서치 전용으로 후처리해 400B 미만 오픈 웨이트 모델 중 평가한 6개 벤치마크 전 항목에서 최고 점수를 낸다.
- Claude Opus 4.7·Kimi-K2.6 등 대형·비공개 모델과도 근접한 HLE·DeepSearchQA 점수를 낸다.
- 장기 계획·영중 웹 탐색·다중 소스 근거 취합에 특화된 사고 모델로, mini보다 더 큰 베이스로 성능을 끌어올렸다.
- AxisAgentic 하니스로 search/scrape/python 도구 계약과 재현 가능한 평가 워크플로를 제공한다.
제한사항
- search·scrape·python 등 실제 도구 실행은 체크포인트가 아니라 AxisAgentic 하니스가 제공하므로, 다른 툴 프레임워크에서는 동일한 성능이 보장되지 않는다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| BrowseComp | accuracy | 84.8 | 400B 미만 오픈 웨이트 중 최고, apodex-h1(대형) 90.3에는 못 미침 |
| DeepSearchQA | F1 | 92.5 | Kimi-K2.6 92.5와 동률 |
| LiveBrowseComp | accuracy | 53.7 | 400B 미만 오픈 웨이트 중 최고 |
| HLE | accuracy | 53.3 | Claude Opus 4.7 54.7에 근접 |
372
LIKES
1.6k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.