본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nex-agi/Nex-N2.5-Pro

텍스트 생성, 컴퓨터 사용, 웹 브라우징, 코드 실행·검증, function calling 및 multimodal agent 작업apache-2.0

화면 피드백과 reasoning 모드로 장기 작업을 수행하는 agentic 모델

학습 방식 · Nex-N2 multimodal 기반에 장기 작업용 agent training 환경·과제·생산성 시나리오를 확장한 post-training을 적용했습니다.

TL;DR

Nex-N2.5-Pro는 Nex-N2의 multimodal 기반을 잇는 agentic text-generation 모델로, 컴퓨터와 브라우저 화면을 읽고 시각 피드백으로 결과를 확인하며 장기 작업을 이어갑니다. `reasoning_effort`를 통해 직접 응답, 적응형 사고, 항상 사고 모드를 선택하고 `qwen3_coder` parser로 function calling을 연결합니다. README 기준 Pro는 BrowseComp 89.7, OSWorld-G 87.4, Terminal-Bench 2.1 82.7을 기록해 웹 탐색·컴퓨터 사용·코딩 작업에 초점을 둡니다. 다만 모델 가중치는 아직 출시 예정이며, 제공된 배포 예시는 8×H100 단일 노드를 요구합니다.

핵심 포인트

  • Nex-N2 기반의 시각 인터페이스가 화면 상태를 읽고 결과를 확인하며 다음 행동으로 연결합니다.
  • `reasoning_effort`를 none·medium·high로 바꿔 직접 응답과 적응형·항상 사고 모드를 선택합니다.
  • `qwen3_coder` parser를 붙이면 function calling 응답을 분리해 외부 도구 연동 경로를 구성합니다.
  • Pro는 BrowseComp 89.7과 OSWorld-G 87.4를 기록해 웹·컴퓨터 사용 작업에 강점을 보입니다.

제한사항

  • Nex-N2.5-Pro 가중치는 README에서 출시 예정으로 안내되어 있어 현재 직접 배포 가능 여부를 확인하기 어렵습니다.
  • README의 Pro 배포 예시는 단일 노드 8×H100 구성과 Nex-AGI의 수정된 `sglang` Docker 이미지를 요구합니다.
  • 벤치마크 수치는 공식 leaderboard·외부 평가 보고서·자체 평가가 함께 사용됐고, 평가는 `temperature = 0.7`, `top_p = 0.95`, `top_k = 40` 설정을 따릅니다.

벤치마크

벤치마크지표비교
Terminal-Bench 2.1score82.7Claude Opus 5 89.1, GPT-5.6 Sol 88.8
SWE-Bench Proscore61.2Claude Opus 5 79.2, Qwen3.8-Max 67.7
DeepSWE v1.1score55.8Claude Opus 5 73.7, GPT-5.6 Sol 72.7
AutomationBench v1.0.6score44.2Claude Opus 5 50.3, GLM-5.3 48.2
Toolathlon Verifiedscore68.5Claude Opus 5와 Kimi-K3가 각각 76.5
GDPval-AA v2score1628Claude Opus 5 1831, GLM-5.3 1763
Job Benchscore41.4Claude Opus 5 65.7, GLM-5.3 58.2
BrowseCompscore89.7Nex-N2.5-Max 92.6, Kimi-K3 91.2
OSWorld-Verifiedscore82.2Qwen3.8-Max 86.1, Kimi-K3 84.8
OSWorld-2score56.4Claude Opus 5 68.3, GPT-5.6 Sol 62.7
WebTestscore52.8GPT-5.6 Sol 54.0, Qwen3.8-Max 52.3
WebArena-Verifiedscore67.6Kimi-K3 71.6, GPT-5.6 Sol 69.7
OSWorld-Gscore87.4표 내 최고 점수이며 Qwen3.8-Max 84.9
Vision2Webscore68.2GPT-5.6 Sol 79.8, Qwen3.8-Max 75.1
SWE-MMscore38.2Claude Opus 5 59.4, GPT-5.6 Sol 40.2
OmniDocscore92.2GPT-5.6 Sol 92.9, Qwen3.8-Max 92.1

이미지 분석

Nex-N2.5 계열과 비교 모델의 텍스트·multimodal 벤치마크 점수를 막대그래프로 비교한 이미지입니다.
이미지는 Text Benchmarks와 Multimodal Benchmarks를 나눠 Nex-N2.5-Pro의 위치를 비교합니다. Pro는 텍스트 부문에서 Terminal-Bench 2.1 82.7, SWE-Bench Pro 61.2, BrowseComp 89.7을 기록하고, multimodal 부문에서는 OSWorld-2 56.4, WebArena-Verified 67.6, OSWorld-G 87.4, SWE-MM 38.2를 기록합니다. 특히 OSWorld-G에서는 비교군 중 가장 높은 87.4가 표시되어 화면 기반 작업 성능을 확인할 수 있습니다.

165

LIKES

0

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.