nex-agi/Nex-N2.5-mini
텍스트 생성, 대화, 컴퓨터 사용, 웹 탐색, 함수 호출, 시각 기반 agent 작업apache-2.0
화면 피드백과 추론 모드를 활용하는 Nex-N2.5 계열의 공개형 multimodal agent 모델
학습 방식 · Nex-N2 multimodal 기반 위에 컴퓨터 사용·웹 탐색·시각 기반 agent 환경과 생산성 작업을 확장한 post-training을 적용했으며, 세부 학습 기법과 데이터 규모는 공개되지 않았습니다.
TL;DR
Nex-N2.5-mini는 Nex-N2 계열의 multimodal 기반을 이어받아 컴퓨터 사용, 웹 탐색, 시각 기반 장기 작업에 맞춘 agentic text-generation 모델입니다. 입력된 화면과 환경 피드백을 바탕으로 행동 결과를 확인하고 다음 단계를 이어가며, `reasoning_effort`로 비사고·적응형 사고·항상 사고 모드를 선택할 수 있습니다. `qwen3_coder` 기반 tool-call parser와 `qwen3` reasoning parser를 사용해 함수 호출과 추론 응답을 분리하며, 코딩·브라우저·컴퓨터 사용 평가에서 mini·Pro·Max 계열 간 성능 차이가 확인됩니다. Apache-2.0 라이선스로 공개됐지만, README의 mini 배포 예시는 2개의 H100 GPU를 요구합니다.
핵심 포인트
- Nex-N2의 multimodal 기반에 컴퓨터 조작·웹 탐색·시각 피드백을 결합해 장기 작업 중 결과를 확인하고 다음 행동으로 이어갑니다.
- `reasoning_effort`를 `none`, `medium`, `high`로 설정해 직접 응답, 적응형 사고, 항상 사고 모드를 선택합니다.
- SGLang에서 `qwen3_coder` tool-call parser와 `qwen3` reasoning parser를 연결해 함수 호출과 추론 내용을 각각 처리합니다.
- Nex-N2.5-mini는 BrowseComp 83.4, OSWorld-G 82.9, Terminal-Bench 2.1 73.4를 기록했으며 Pro·Max보다 낮은 계열 내 점수입니다.
제한사항
- README는 Nex-N2.5-mini의 파라미터 수와 context length를 공개하지 않아 모델 규모와 최대 입력 길이를 확인하기 어렵습니다.
- 성능 수치는 NexAU·NexCUA 평가 하네스와 temperature 0.7, top_p 0.95, top_k 40 설정을 사용하므로 다른 평가 조건과 직접 비교할 때 조건 차이를 확인해야 합니다.
- README의 Nex-N2.5-mini 배포 예시는 2 × H100 단일 노드를 요구하며, 일반적인 저사양 GPU 실행 조건은 제시되지 않았습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 | score | 73.4 | Nex-N2.5-Pro 82.7, Nex-N2.5-Max 86.1, Claude Opus 5 89.1 |
| SWE-Bench Pro | score | 43.8 | Nex-N2.5-Pro 61.2, Nex-N2.5-Max 65.7, Claude Opus 5 79.2 |
| DeepSWE v1.1 | score | 36.1 | Nex-N2.5-Pro 55.8, Nex-N2.5-Max 65.6, Claude Opus 5 73.7 |
| AutomationBench v1.0.6 | score | 32.3 | Nex-N2.5-Pro 44.2, Nex-N2.5-Max 50.2, Claude Opus 5 50.3 |
| Toolathlon Verified | score | 54.6 | Nex-N2.5-Pro 68.5, Nex-N2.5-Max 74.7, Claude Opus 5 및 Kimi-K3 76.5 |
| GDPval-AA v2 | score | 1446 | Nex-N2.5-Pro 1628, Nex-N2.5-Max 1713, Claude Opus 5 1831 |
| Job Bench | score | 28.5 | Nex-N2.5-Pro 41.4, Nex-N2.5-Max 53.6, Claude Opus 5 65.7 |
| BrowseComp | score | 83.4 | Nex-N2.5-Pro 89.7, Nex-N2.5-Max 92.6, Claude Opus 5 90.8 |
| OSWorld-Verified | score | 71.2 | Nex-N2.5-Pro 82.2, Kimi-K3 84.8, Qwen3.8-Max 86.1 |
| OSWorld-2 | score | 30.5 | Nex-N2.5-Pro 56.4, Claude Opus 5 68.3, GPT-5.6 Sol 62.7 |
| WebTest | score | 48.6 | Nex-N2.5-Pro 52.8, GPT-5.6 Sol 54.0 |
| WebArena-Verified | score | 63.4 | Nex-N2.5-Pro 67.6, GPT-5.6 Sol 69.7, Kimi-K3 71.6 |
| OSWorld-G | score | 82.9 | Nex-N2.5-Pro 87.4, GPT-5.6 Sol 77.7, Qwen3.8-Max 84.9 |
| Vision2Web | score | 52.9 | Nex-N2.5-Pro 68.2, GPT-5.6 Sol 79.8, Qwen3.8-Max 75.1 |
| SWE-MM | score | 25.5 | Nex-N2.5-Pro 38.2, Claude Opus 5 59.4, GPT-5.6 Sol 40.2 |
| OmniDoc | score | 89.7 | Nex-N2.5-Pro 92.2, GPT-5.6 Sol 92.9, Qwen3.8-Max 92.1 |
이미지 분석

204
LIKES
2
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.