nex-agi/Nex-N2.5-Pro
텍스트 생성, 컴퓨터 사용, 웹 브라우징, 코드 실행·검증, function calling 및 multimodal agent 작업apache-2.0
화면 피드백과 reasoning 모드로 장기 작업을 수행하는 agentic 모델
학습 방식 · Nex-N2 multimodal 기반에 장기 작업용 agent training 환경·과제·생산성 시나리오를 확장한 post-training을 적용했습니다.
TL;DR
Nex-N2.5-Pro는 Nex-N2의 multimodal 기반을 잇는 agentic text-generation 모델로, 컴퓨터와 브라우저 화면을 읽고 시각 피드백으로 결과를 확인하며 장기 작업을 이어갑니다. `reasoning_effort`를 통해 직접 응답, 적응형 사고, 항상 사고 모드를 선택하고 `qwen3_coder` parser로 function calling을 연결합니다. README 기준 Pro는 BrowseComp 89.7, OSWorld-G 87.4, Terminal-Bench 2.1 82.7을 기록해 웹 탐색·컴퓨터 사용·코딩 작업에 초점을 둡니다. 다만 모델 가중치는 아직 출시 예정이며, 제공된 배포 예시는 8×H100 단일 노드를 요구합니다.
핵심 포인트
- Nex-N2 기반의 시각 인터페이스가 화면 상태를 읽고 결과를 확인하며 다음 행동으로 연결합니다.
- `reasoning_effort`를 none·medium·high로 바꿔 직접 응답과 적응형·항상 사고 모드를 선택합니다.
- `qwen3_coder` parser를 붙이면 function calling 응답을 분리해 외부 도구 연동 경로를 구성합니다.
- Pro는 BrowseComp 89.7과 OSWorld-G 87.4를 기록해 웹·컴퓨터 사용 작업에 강점을 보입니다.
제한사항
- Nex-N2.5-Pro 가중치는 README에서 출시 예정으로 안내되어 있어 현재 직접 배포 가능 여부를 확인하기 어렵습니다.
- README의 Pro 배포 예시는 단일 노드 8×H100 구성과 Nex-AGI의 수정된 `sglang` Docker 이미지를 요구합니다.
- 벤치마크 수치는 공식 leaderboard·외부 평가 보고서·자체 평가가 함께 사용됐고, 평가는 `temperature = 0.7`, `top_p = 0.95`, `top_k = 40` 설정을 따릅니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 | score | 82.7 | Claude Opus 5 89.1, GPT-5.6 Sol 88.8 |
| SWE-Bench Pro | score | 61.2 | Claude Opus 5 79.2, Qwen3.8-Max 67.7 |
| DeepSWE v1.1 | score | 55.8 | Claude Opus 5 73.7, GPT-5.6 Sol 72.7 |
| AutomationBench v1.0.6 | score | 44.2 | Claude Opus 5 50.3, GLM-5.3 48.2 |
| Toolathlon Verified | score | 68.5 | Claude Opus 5와 Kimi-K3가 각각 76.5 |
| GDPval-AA v2 | score | 1628 | Claude Opus 5 1831, GLM-5.3 1763 |
| Job Bench | score | 41.4 | Claude Opus 5 65.7, GLM-5.3 58.2 |
| BrowseComp | score | 89.7 | Nex-N2.5-Max 92.6, Kimi-K3 91.2 |
| OSWorld-Verified | score | 82.2 | Qwen3.8-Max 86.1, Kimi-K3 84.8 |
| OSWorld-2 | score | 56.4 | Claude Opus 5 68.3, GPT-5.6 Sol 62.7 |
| WebTest | score | 52.8 | GPT-5.6 Sol 54.0, Qwen3.8-Max 52.3 |
| WebArena-Verified | score | 67.6 | Kimi-K3 71.6, GPT-5.6 Sol 69.7 |
| OSWorld-G | score | 87.4 | 표 내 최고 점수이며 Qwen3.8-Max 84.9 |
| Vision2Web | score | 68.2 | GPT-5.6 Sol 79.8, Qwen3.8-Max 75.1 |
| SWE-MM | score | 38.2 | Claude Opus 5 59.4, GPT-5.6 Sol 40.2 |
| OmniDoc | score | 92.2 | GPT-5.6 Sol 92.9, Qwen3.8-Max 92.1 |
이미지 분석

165
LIKES
0
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.