apodex/Apodex-1.1-mini
복잡한 장기 연구 과제를 위한 도구 사용형 에이전트35B-A3B262K 컨텍스트apache-2.0
Qwen3.5-35B-A3B 기반 Agent 모델로 도구 호출과 병렬 작업, 결과 검증을 결합합니다.
학습 방식 · Qwen3.5-35B-A3B 기반 Fine-tune 모델로, Agent Team과 native function calling을 활용하는 복잡한 장기 작업 수행에 특화되었습니다.
TL;DR
Apodex-1.1-mini는 Qwen3.5-35B-A3B를 기반으로 복잡한 장기 연구 작업에 맞춘 Agent 특화 Fine-tune 모델입니다. Agent Team이 과제를 여러 Subagent 작업으로 분해하고 병렬 결과를 공유 상태에 합치며, 도구 호출과 파일·데이터·코드 처리를 반복해 최종 결과물을 만듭니다. Statement Review는 주장과 출처, 계산을 별도로 대조해 근거가 부족하거나 서로 충돌하는 결론을 수정합니다. README 공개 평가에서 Agent Team은 APEX-Agent 27.7, FrontierFinance 50.2, FrontierScience-Research 51.7을 기록해 각 벤치마크의 ReAct 점수 24.2, 40.0, 45.0을 앞섰습니다.
핵심 포인트
- Qwen3.5-35B-A3B를 기반으로 복잡한 연구 작업을 단계별로 처리하는 Fine-tune 모델입니다. 파일과 데이터, 코드, 이미지, 외부 도구를 한 작업 흐름에서 다룹니다. 단순 응답보다 검증 가능한 결과물 완성을 목표로 합니다.
- Agent Team이 과제를 여러 하위 작업으로 나누고 병렬 Subagent의 결과를 공유 상태에 통합합니다. 새 파일이나 사용자 피드백이 들어오면 우선순위와 계획을 조정합니다. 완료된 작업을 유지하므로 전체 과정을 처음부터 다시 시작하지 않습니다.
- Statement Review가 핵심 주장과 출처, 데이터, 계산 결과를 별도로 대조합니다. 근거 부족이나 인용 불일치, 결과 충돌이 발견되면 해당 결론을 수정하고 검토 과정을 확인할 수 있게 남깁니다. 연구 보고서의 최종 전달 전에 사실 검증 단계를 포함한 구조입니다.
제한사항
- 실행에 사용할 파일, 데이터, 코드 또는 도구가 제공되어야 하며, 모델 자체만으로는 README가 제시한 end-to-end 작업 흐름을 재현할 수 없습니다.
- 권장 배포 명령은 SGLang 또는 vLLM에서 tensor parallel size 8과 262,144 컨텍스트를 사용하므로 소규모 단일 GPU 환경에는 부담이 될 수 있습니다.
- 평가 중 관련 benchmark 호스팅 웹사이트 접근을 차단했다는 조건이 적용되어 공개 점수를 다른 평가 설정과 직접 비교할 때 주의가 필요합니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| APEX-Agent | score | 27.7 | README와 차트 기준으로 Kimi K2.6의 27.9에 근접했으며, Apodex Mini ReAct의 24.2보다 높음 |
| FrontierFinance | score | 50.2 | 차트에 포함된 Claude Fable 5의 49.2보다 높아 비교 항목 중 가장 높은 점수 |
| FrontierScience-Research | score | 51.7 | 차트의 DeepSeek V4 Flash 0731 55.0보다는 낮고, Seed2.1 Deep Think 40.7과 GPT-5.5 33.9보다 높음 |
이미지 분석


91
LIKES
1.3k
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.