검색 특화 경량 Thinking 모델
이 모델은 텍스트 생성 태스크를 중심으로 동작하며 특히 에이전틱 검색 작업에서 장기 계획과 도구 호출을 결합한 응답을 생성합니다. 입력으로는 자연어 질의와 시스템 프롬프트, 그리고 도구 스키마가 결합된 채팅 메시지를 받으며 출력으로는 Qwen 호환의 reasoning 텍스트와 구조화된 툴 호출을 모두 생성할 수 있습니다. 이렇게 생성된 툴 호출과 이후 도구 결과를 순차적으로 소비해 증거 집계와 사실 검증을 수행하도록 설계되어 있습니다.256K 컨텍스트apache-2.0
Qwen3.6-35B 기반으로 포스트트레이닝된 에이전틱 검색용 경량 모델
TL;DR
XYZ-Aquila-mini는 Qwen/Qwen3.6-35B-A3B를 기반으로 AI4AI 유한 탐색 파이프라인으로 포스트트레이닝된 에이전틱 검색용 thinking 모델입니다. 입력으로 채팅형 프롬프트와 도구 스키마를 받아 Qwen 호환의 reasoning 텍스트와 구조화된 툴 호출을 생성하고 AxisAgentic 하니스와 결합해 웹 검색·페이지 추출·상태 유지형 코드 실행을 포함한 장기 계획형 작업을 수행합니다. 공개 벤치마크 표에서는 소규모 오픈웨이트 그룹의 여러 벤치마크 열에서 최고 점수를 보고하고 있으며 배포 예시는 SGLang 기반 엔드포인트와 262144 길이 컨텍스트를 권장하고 있습니다.
핵심 역량
- 장기 계획 기반의 에이전틱 검색 워크플로우에서 사용자가 제시한 목표를 단계별 도구 호출로 변환하는 능력을 보유합니다. 입력 프롬프트와 툴 스키마를 분석해 단일 도구를 호출하는 결정을 내리고, 도구 결과를 받아 다음 행동을 설계하는 루프를 지속합니다. 이러한 행위는 웹 검색·페이지 추출·상태 유지형 코드 실행 같은 외부 툴과 결합될 때 전체 기능을 발휘합니다.
- 영어와 중국어 웹 브라우징을 포함한 다국어 정보 수집과 다중 소스 증거 집계를 지원합니다. 검색 결과와 페이지에서 추출한 사실을 교차검증해 신뢰도를 판단하고 증거 기반의 결론을 생성하는 과정에서 모델이 생성한 reasoning 텍스트와 도구 호출 포맷을 활용합니다. README는 이 과정이 모델 자체와 함께 AxisAgentic 하니스의 구현을 통해 운영된다고 명시합니다.
- 실패 복구와 소스 검증 루틴을 포함한 에이전트형 상호작용을 수행할 수 있습니다. 환경 상호작용에서 실패가 발생할 때 진단과 국지적 개입을 제안하는 방식으로 후속 행동을 재설계하며, 이러한 제안은 AI4AI 파이프라인의 진단-개입 흐름을 반영합니다. 모델은 하니스에서 제공하는 고정된 툴 계약을 기대하며, 단독 체크포인트만으로는 하니스 기능 전부를 수행하지 않습니다.
강점
- 에이전틱 검색 벤치마크에서 소규모 오픈웨이트 그룹의 최상위 성적을 보고하고 있습니다. 표에서 BrowseComp 78.8, DeepSearchQA 89.5, GAIA 97.1 같은 수치가 제공되며 이는 동일 그룹의 다른 모델보다 높은 열별 점수로 제시되어 있습니다. 이러한 수치는 모델이 장기 계획과 증거 집계가 요구되는 검색형 작업에서 경쟁력을 갖췄음을 시사합니다.
- Qwen 호환의 reasoning 및 tool-call 포맷을 출력하도록 조정되어 있는 점은 기존 Qwen 생태계와의 상호운용성 측면에서 강점입니다. README는 reasoning-parser qwen3 및 tool-call-parser qwen3_coder를 사용해 런타임에서 Qwen 스타일 파싱을 기대한다고 명시합니다. 따라서 Qwen 기반 도구 해석기나 하니스와 결합할 때 운영 복잡도를 줄일 수 있습니다.
- 다국어 웹 브라우징과 출처 검증 워크플로우에 초점을 맞춰 영어와 중국어 환경에서의 성능을 강조하고 있습니다. BrowseComp-ZH에서 82.9라는 수치를 포함해 중국어 관련 벤치마크 성적을 공개하고 있습니다. 이 점은 다언어 정보 수집·검증 작업에 실제로 활용 가능한 역량을 제공할 가능성을 높입니다.
훈련 방식
포스트트레이닝 관점에서 XYZ-Aquila-mini는 Qwen/Qwen3.6-35B-A3B를 출발점으로 AI4AI의 유한 탐색 루프를 통해 추가적으로 학습되었습니다. 인간 설계자의 목표·제약·수용 정책과 AI 에이전트의 실패 진단 및 국지적 개입 제안이 반복되는 방식으로 데이터와 포스트트레이닝 스텝을 조정해 에이전틱 능력을 향상시켰습니다. README와 연결된 데이터셋 XYZ-Aquila-SFT 및 AxisAgentic 하니스가 학습·평가 워크플로우의 일부로 명시되어 있습니다.
알아두면 좋은 것
- XYZ-Aquila-mini는 Qwen/Qwen3.6-35B-A3B를 기반으로 AI4AI 유한 탐색 파이프라인을 통해 포스트트레이닝된 thinking 모델입니다. 인간이 목표·증거·제약·위험 한계를 정의하고 AI 에이전트가 실패를 진단해 국지적 개입을 제안하는 절차를 통해 모델의 에이전틱 능력을 개선합니다. 모델은 Qwen 호환의 reasoning 및 tool-call 포맷을 출력하도록 최적화되어 있습니다.
- 모델은 에이전틱 검색, 장기 계획, 다중 소스 증거 집계, 출처 검증, 실패 상호작용 복구 같은 검색 중심 능력에 초점을 맞추고 있습니다. 실제 도구 구현과 고정된 툴 계약, 재현 가능한 컨텍스트 관리는 공개된 AxisAgentic 하니스가 제공하며 README는 하니스와의 결합이 전체 역량 발휘에 필수적이라고 밝힙니다. 평가 파이프라인은 웹 검색·페이지 추출·상태 유지형 Python 실행을 포함한 ReAct 스타일의 검색 하니스를 사용합니다.
- 공개된 벤치마크에서 소규모(<40B) 오픈웨이트 그룹의 모든 열에서 최고 점수를 기록했다고 보고하고 있습니다. README의 표에서 XYZ-Aquila-mini는 BrowseComp 78.8, BrowseComp-ZH 82.9, DeepSearchQA 89.5, GAIA 97.1, LiveBrowseComp 48.7, HLE 51.1, WideSearch 80.8 등의 수치를 보입니다. 기술 보고서와 벤치마크 표는 결과의 출처와 재현 절차를 해당 기술 보고서로 안내합니다.
- 배포 권장은 SGLang과의 통합으로, 컨텍스트 길이 262144, 텐서 병렬 tp-size 8 등을 예시로 제시합니다. README 예시는 OpenAI 호환 엔드포인트로 모델을 띄우는 설정과 도구 호출 규칙을 포함하는 샘플을 제공합니다. 실환경 메모리 제약이 있을 경우 텐서 병렬 크기와 컨텍스트 길이를 줄이라고 안내합니다.
기술적 특징
- 체크포인트는 'thinking model'으로 정의되어 도구 호출과 증거 집계, 실패 복구 같은 중간 행동을 생성하는 출력 형태를 마련합니다. 모델 출력은 Qwen 스타일의 reasoning 텍스트와 구조화된 툴 호출을 포함하며 AxisAgentic 하니스가 구체적 툴 구현과 고정된 툴 계약을 맡습니다. 이 분리는 체크포인트의 역할과 하니스의 역할을 런타임 수준에서 분명히 구분합니다.
- 평가 파이프라인은 ReAct 스타일의 검색 하니스를 사용하며 웹 검색·웹페이지 추출·상태 유지형 Python 실행을 포함합니다. README는 평가에서 최대 256K 컨텍스트를 허용했다고 밝히며 실배포 권장 컨텍스트는 262144로 제시합니다. 이러한 긴 컨텍스트 지원은 장기 흐름 유지와 대규모 증거 집계에 도움이 됩니다.
- AI4AI 유한 탐색 프로세스가 포스트트레이닝 및 최적화 루프의 핵심으로 작동합니다. 인간이 정책과 위험 한계를 설정하고 에이전트가 실패 사례를 진단하며 데이터·학습·런타임 측면에서 국지적 개입을 제안하는 반복 루프를 통해 성능을 개선하도록 설계되어 있습니다. README와 기술 보고서는 이 절차와 벤치마크 재현성을 별도 문서로 연결하고 있습니다.
차별점
- 소규모(<40B) 공개 가중치 그룹 내에서 열별로 최고 점수를 보고한 벤치마크 포지셔닝을 내세우고 있습니다. README의 표는 여러 벤치마크에서 XYZ-Aquila-mini가 최상위 수치를 갖는 것으로 제시하며 기술 보고서로 상세 근거를 연결합니다. 이러한 벤치마크 포지셔닝은 검색형 에이전트 워크로드에 특화된 튜닝의 결과로 표명됩니다.
- Qwen3.6-35B-A3B 기반의 포스트트레이닝 체크포인트라는 점과 AxisAgentic 하니스로 도구 구현을 분리한 설계가 제품 생태계 차별점입니다. 모델은 Qwen 호환 파서를 전제로 설계되므로 Qwen 생태계와의 상호운용성에서 이점을 확보합니다. 하니스 분리는 모델이 생성하는 툴 호출을 표준화된 계약 아래에서 실행 가능하게 만들어 개발·평가 재현성을 지원합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| BrowseComp | accuracy | 78.8 | vs Agents-A1: 75.5 |
| BrowseComp-ZH | accuracy | 82.9 | vs Nex-N2-mini: 79.6† |
| DeepSearchQA | F1 | 89.5 | vs Nex-N2-mini: 87.2† |
| GAIA | accuracy | 97.1 | vs Agents-A1: 96.0 |
| LiveBrowseComp | accuracy | 48.7 | vs Agents-A1: 29.6† |
| WideSearch | Item F1 Max@4 | 80.8 | vs Nex-N2-mini: 62.0 |
이미지 분석
242
Likes
447
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.