XYZAILab/XYZ-Aquila-mini
장기 웹 탐색과 다중 소스 근거 검증을 수행하는 딥 서치 전용 에이전틱 사고 모델(35B-A3B)35B-A3B262K 컨텍스트apache-2.0
40B 미만 오픈 웨이트 딥 서치 비교표의 모든 항목에서 최고 점수를 낸 35B 검색 에이전트
학습 방식 · Qwen3.6-35B-A3B를 바탕으로 AI4AI라는 bounded-exploration 파이프라인(사람이 목표·제약·위험경계를 정의하고 AI 에이전트가 실패를 진단해 개입을 제안)으로 데이터·후처리·런타임 전반을 최적화했다.
TL;DR
XYZ-Aquila-mini는 Qwen3.6-35B-A3B를 딥 서치 전용으로 후처리한 사고 모델로, 사람이 목표·근거·제약·위험 경계를 정의하고 AI 에이전트가 실패를 진단해 개입을 제안하는 AI4AI 파이프라인으로 데이터부터 후처리·런타임까지 반복 개선했다. 장기 계획, 영중 웹 브라우징, 다중 소스 근거 취합, 출처 검증, 실패한 도구 호출로부터의 복구에 최적화됐으며, BrowseComp 78.8·GAIA 97.1·HLE 51.1 등 40B 미만 오픈 웨이트 비교표의 모든 항목에서 최고 점수를 기록했다. AxisAgentic이라는 오픈소스 하니스가 search/scrape/python 도구 계약과 재현 가능한 컨텍스트 관리, 평가 워크플로를 제공하며 체크포인트 단독으로는 이 도구 실행 능력을 갖지 않는다. 검색 에이전트를 자체 인프라에 저비용으로 배치하려는 팀에 적합하다.
핵심 포인트
- Qwen3.6-35B-A3B를 딥 서치 전용으로 후처리해 40B 미만 오픈 웨이트 비교표의 모든 항목에서 최고 점수를 냈다.
- 장기 계획·영중 웹 탐색·다중 소스 근거 취합·출처 검증·실패한 도구 호출 복구에 최적화된 사고 모델이다.
- AxisAgentic이라는 오픈소스 하니스가 search/scrape/python 도구 계약과 재현 가능한 컨텍스트 관리를 제공한다.
- 사람이 목표와 위험 경계를 정의하고 AI 에이전트가 개입을 제안하는 AI4AI 파이프라인으로 데이터부터 인프라까지 반복 개선했다.
제한사항
- search·scrape·python 등 실제 도구 실행은 체크포인트가 아니라 AxisAgentic 하니스가 제공하므로, 다른 툴 프레임워크에서는 동일한 성능이 보장되지 않는다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| BrowseComp | accuracy | 78.8 | 40B 미만 오픈 웨이트 중 최고(Agents-A1 75.5) |
| GAIA | accuracy | 97.1 | Agents-A1 96.0 |
| HLE | accuracy | 51.1 | 40B 미만 오픈 웨이트 중 최고 |
| WideSearch | Item F1 Max@4 | 80.8 | — |
424
LIKES
1.6k
DOWNLOADS
1 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.