본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

nex-agi/Nex-N2.5-mini

텍스트 생성, 대화, 컴퓨터 사용, 웹 탐색, 함수 호출, 시각 기반 agent 작업apache-2.0

화면 피드백과 추론 모드를 활용하는 Nex-N2.5 계열의 공개형 multimodal agent 모델

학습 방식 · Nex-N2 multimodal 기반 위에 컴퓨터 사용·웹 탐색·시각 기반 agent 환경과 생산성 작업을 확장한 post-training을 적용했으며, 세부 학습 기법과 데이터 규모는 공개되지 않았습니다.

TL;DR

Nex-N2.5-mini는 Nex-N2 계열의 multimodal 기반을 이어받아 컴퓨터 사용, 웹 탐색, 시각 기반 장기 작업에 맞춘 agentic text-generation 모델입니다. 입력된 화면과 환경 피드백을 바탕으로 행동 결과를 확인하고 다음 단계를 이어가며, `reasoning_effort`로 비사고·적응형 사고·항상 사고 모드를 선택할 수 있습니다. `qwen3_coder` 기반 tool-call parser와 `qwen3` reasoning parser를 사용해 함수 호출과 추론 응답을 분리하며, 코딩·브라우저·컴퓨터 사용 평가에서 mini·Pro·Max 계열 간 성능 차이가 확인됩니다. Apache-2.0 라이선스로 공개됐지만, README의 mini 배포 예시는 2개의 H100 GPU를 요구합니다.

핵심 포인트

  • Nex-N2의 multimodal 기반에 컴퓨터 조작·웹 탐색·시각 피드백을 결합해 장기 작업 중 결과를 확인하고 다음 행동으로 이어갑니다.
  • `reasoning_effort`를 `none`, `medium`, `high`로 설정해 직접 응답, 적응형 사고, 항상 사고 모드를 선택합니다.
  • SGLang에서 `qwen3_coder` tool-call parser와 `qwen3` reasoning parser를 연결해 함수 호출과 추론 내용을 각각 처리합니다.
  • Nex-N2.5-mini는 BrowseComp 83.4, OSWorld-G 82.9, Terminal-Bench 2.1 73.4를 기록했으며 Pro·Max보다 낮은 계열 내 점수입니다.

제한사항

  • README는 Nex-N2.5-mini의 파라미터 수와 context length를 공개하지 않아 모델 규모와 최대 입력 길이를 확인하기 어렵습니다.
  • 성능 수치는 NexAU·NexCUA 평가 하네스와 temperature 0.7, top_p 0.95, top_k 40 설정을 사용하므로 다른 평가 조건과 직접 비교할 때 조건 차이를 확인해야 합니다.
  • README의 Nex-N2.5-mini 배포 예시는 2 × H100 단일 노드를 요구하며, 일반적인 저사양 GPU 실행 조건은 제시되지 않았습니다.

벤치마크

벤치마크지표비교
Terminal-Bench 2.1score73.4Nex-N2.5-Pro 82.7, Nex-N2.5-Max 86.1, Claude Opus 5 89.1
SWE-Bench Proscore43.8Nex-N2.5-Pro 61.2, Nex-N2.5-Max 65.7, Claude Opus 5 79.2
DeepSWE v1.1score36.1Nex-N2.5-Pro 55.8, Nex-N2.5-Max 65.6, Claude Opus 5 73.7
AutomationBench v1.0.6score32.3Nex-N2.5-Pro 44.2, Nex-N2.5-Max 50.2, Claude Opus 5 50.3
Toolathlon Verifiedscore54.6Nex-N2.5-Pro 68.5, Nex-N2.5-Max 74.7, Claude Opus 5 및 Kimi-K3 76.5
GDPval-AA v2score1446Nex-N2.5-Pro 1628, Nex-N2.5-Max 1713, Claude Opus 5 1831
Job Benchscore28.5Nex-N2.5-Pro 41.4, Nex-N2.5-Max 53.6, Claude Opus 5 65.7
BrowseCompscore83.4Nex-N2.5-Pro 89.7, Nex-N2.5-Max 92.6, Claude Opus 5 90.8
OSWorld-Verifiedscore71.2Nex-N2.5-Pro 82.2, Kimi-K3 84.8, Qwen3.8-Max 86.1
OSWorld-2score30.5Nex-N2.5-Pro 56.4, Claude Opus 5 68.3, GPT-5.6 Sol 62.7
WebTestscore48.6Nex-N2.5-Pro 52.8, GPT-5.6 Sol 54.0
WebArena-Verifiedscore63.4Nex-N2.5-Pro 67.6, GPT-5.6 Sol 69.7, Kimi-K3 71.6
OSWorld-Gscore82.9Nex-N2.5-Pro 87.4, GPT-5.6 Sol 77.7, Qwen3.8-Max 84.9
Vision2Webscore52.9Nex-N2.5-Pro 68.2, GPT-5.6 Sol 79.8, Qwen3.8-Max 75.1
SWE-MMscore25.5Nex-N2.5-Pro 38.2, Claude Opus 5 59.4, GPT-5.6 Sol 40.2
OmniDocscore89.7Nex-N2.5-Pro 92.2, GPT-5.6 Sol 92.9, Qwen3.8-Max 92.1

이미지 분석

Nex-N2.5 계열과 여러 비교 모델의 Text 및 Multimodal 벤치마크 점수를 막대그래프로 정리한 이미지입니다.
이미지는 Terminal-Bench 2.1, SWE-Bench Pro, DeepSWE v1.1, AutomationBench, Toolathlon Verified, GDPval-AA v2와 OSWorld-2, WebArena-Verified, SWE-MM 등의 점수를 Nex-N2.5-mini·Pro·Max 및 비교 모델별로 나눠 표시합니다. Nex-N2.5-mini는 Text 영역에서 Terminal-Bench 2.1 73.4, SWE-Bench Pro 43.8, DeepSWE v1.1 36.1을 기록하고, Multimodal 영역에서는 OSWorld-2 30.5, WebArena-Verified 63.4, SWE-MM 25.5로 나타나 계열 내 Pro·Max보다 낮은 점수 구간을 형성합니다.

204

LIKES

2

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.