본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

XYZAILab/XYZ-Aquila-pro

장기 웹 탐색과 다중 소스 근거 검증을 수행하는 딥 서치 전용 에이전틱 사고 모델(397B-A17B)397B-A17B262K 컨텍스트apache-2.0

400B 미만 오픈 웨이트 딥 서치 모델 중 최고 점수를 내며 일부 대형 비공개 모델에도 근접한 397B 검색 에이전트

학습 방식 · Qwen3.5-397B-A17B를 바탕으로 AI4AI라는 bounded-exploration 파이프라인(사람이 목표·제약·위험경계를 정의하고 AI 에이전트가 실패를 진단해 개입을 제안)으로 데이터·후처리·런타임 전반을 최적화했다.

TL;DR

XYZ-Aquila-pro는 Qwen3.5-397B-A17B를 같은 AI4AI 파이프라인으로 딥 서치 전용 후처리한 사고 모델로, BrowseComp 84.8·DeepSearchQA 92.5·HLE 53.3 등 평가한 6개 벤치마크 전 항목에서 400B 미만 오픈 웨이트 모델 중 최고 점수를 기록했다. Claude Opus 4.7(HLE 54.7)이나 Kimi-K2.6(DeepSearchQA 92.5) 같은 훨씬 크거나 비공개인 프런티어 모델과도 근접하거나 동률인 점수를 낸다. mini와 마찬가지로 장기 계획, 영중 웹 브라우징, 다중 소스 근거 취합, 출처 검증에 최적화됐으며 AxisAgentic 하니스가 실제 도구 실행과 재현 가능한 평가 워크플로를 제공한다. 더 큰 베이스 모델의 여유를 활용해 최상위권 딥 서치 성능을 오픈 웨이트로 확보하려는 조직에 적합하다.

핵심 포인트

  • Qwen3.5-397B-A17B를 딥 서치 전용으로 후처리해 400B 미만 오픈 웨이트 모델 중 평가한 6개 벤치마크 전 항목에서 최고 점수를 낸다.
  • Claude Opus 4.7·Kimi-K2.6 등 대형·비공개 모델과도 근접한 HLE·DeepSearchQA 점수를 낸다.
  • 장기 계획·영중 웹 탐색·다중 소스 근거 취합에 특화된 사고 모델로, mini보다 더 큰 베이스로 성능을 끌어올렸다.
  • AxisAgentic 하니스로 search/scrape/python 도구 계약과 재현 가능한 평가 워크플로를 제공한다.

제한사항

  • search·scrape·python 등 실제 도구 실행은 체크포인트가 아니라 AxisAgentic 하니스가 제공하므로, 다른 툴 프레임워크에서는 동일한 성능이 보장되지 않는다.

벤치마크

벤치마크지표비교
BrowseCompaccuracy84.8400B 미만 오픈 웨이트 중 최고, apodex-h1(대형) 90.3에는 못 미침
DeepSearchQAF192.5Kimi-K2.6 92.5와 동률
LiveBrowseCompaccuracy53.7400B 미만 오픈 웨이트 중 최고
HLEaccuracy53.3Claude Opus 4.7 54.7에 근접

372

LIKES

1.6k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.