본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

XYZAILab/XYZ-Aquila-mini

장기 웹 탐색과 다중 소스 근거 검증을 수행하는 딥 서치 전용 에이전틱 사고 모델(35B-A3B)35B-A3B262K 컨텍스트apache-2.0

40B 미만 오픈 웨이트 딥 서치 비교표의 모든 항목에서 최고 점수를 낸 35B 검색 에이전트

학습 방식 · Qwen3.6-35B-A3B를 바탕으로 AI4AI라는 bounded-exploration 파이프라인(사람이 목표·제약·위험경계를 정의하고 AI 에이전트가 실패를 진단해 개입을 제안)으로 데이터·후처리·런타임 전반을 최적화했다.

TL;DR

XYZ-Aquila-mini는 Qwen3.6-35B-A3B를 딥 서치 전용으로 후처리한 사고 모델로, 사람이 목표·근거·제약·위험 경계를 정의하고 AI 에이전트가 실패를 진단해 개입을 제안하는 AI4AI 파이프라인으로 데이터부터 후처리·런타임까지 반복 개선했다. 장기 계획, 영중 웹 브라우징, 다중 소스 근거 취합, 출처 검증, 실패한 도구 호출로부터의 복구에 최적화됐으며, BrowseComp 78.8·GAIA 97.1·HLE 51.1 등 40B 미만 오픈 웨이트 비교표의 모든 항목에서 최고 점수를 기록했다. AxisAgentic이라는 오픈소스 하니스가 search/scrape/python 도구 계약과 재현 가능한 컨텍스트 관리, 평가 워크플로를 제공하며 체크포인트 단독으로는 이 도구 실행 능력을 갖지 않는다. 검색 에이전트를 자체 인프라에 저비용으로 배치하려는 팀에 적합하다.

핵심 포인트

  • Qwen3.6-35B-A3B를 딥 서치 전용으로 후처리해 40B 미만 오픈 웨이트 비교표의 모든 항목에서 최고 점수를 냈다.
  • 장기 계획·영중 웹 탐색·다중 소스 근거 취합·출처 검증·실패한 도구 호출 복구에 최적화된 사고 모델이다.
  • AxisAgentic이라는 오픈소스 하니스가 search/scrape/python 도구 계약과 재현 가능한 컨텍스트 관리를 제공한다.
  • 사람이 목표와 위험 경계를 정의하고 AI 에이전트가 개입을 제안하는 AI4AI 파이프라인으로 데이터부터 인프라까지 반복 개선했다.

제한사항

  • search·scrape·python 등 실제 도구 실행은 체크포인트가 아니라 AxisAgentic 하니스가 제공하므로, 다른 툴 프레임워크에서는 동일한 성능이 보장되지 않는다.

벤치마크

벤치마크지표비교
BrowseCompaccuracy78.840B 미만 오픈 웨이트 중 최고(Agents-A1 75.5)
GAIAaccuracy97.1Agents-A1 96.0
HLEaccuracy51.140B 미만 오픈 웨이트 중 최고
WideSearchItem F1 Max@480.8

424

LIKES

1.6k

DOWNLOADS

1 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.