nex-agi/Nex-N2-Pro
Qwen3.5-기반으로 post-training한 에이전트 지향 대형 언어모델로, 함수 호출·추론 트레이스·터미널 실행 등 장기 워크플로에서 우수한 코딩·에이전트 성능을 목표로 한다.
학습 방식 · Qwen3.5 계열(Qwen3.5-397B-A17B 기반)을 가져와 에이전트적 워크플로와 코딩 성능 강화를 목적으로 post-training을 수행함.
TL;DR
Nex-N2-Pro는 Qwen3.5 계열을 기반으로 post-training을 거쳐 에이전트 워크플로와 코딩 과제에 특화된 대형 언어모델이다. 모델은 에이전트적 사고(Agentic Thinking) 프레임워크를 통해 요구 파악, 계획, 코드 구현, 환경 피드백, 평가·디버깅을 하나의 폐회로로 연결해 장기 과제와 도구 연동을 원활히 수행하도록 설계되었다. 핵심 기술로는 Adaptive Thinking(간단한 작업은 빠르게 실행하고 중요 결정은 심층 추론)과 Coherent Thinking(다양한 과제와 모달리티에 걸쳐 일관된 추론 패턴 유지)이 있으며, 함수 호출 파싱(qwen3_coder)과 추론 트레이스 분리(qwen3)를 런타임 플래그로 제공해 구조화된 도구 연동과 디버깅을 지원한다. README는 Nex-N2-Pro가 Qwen3.5-397B-A17B 기반임을 명시하고 Terminal-Bench 2.1: 75.3, GDPval: 1585 등 여러 벤치마크 수치를 제시해 코딩·장기 계획 평가에서 높은 성능을 보고했다. 그 결과 Nex-N2-Pro는 도구 호출·터미널 실행·장기 계획을 포함한 실무적 에이전트 워크플로에서 실용적 이점을 제공한다. 트레이드오프로는 대형 모델 특성상 H100급 다중 GPU 환경과 sglang 기반 서빙 구성이 권장되며, README에 명시된 기술적 세부(학습 기법 세부, 컨퍼런스급 벤치마크와의 직접 비교 분석)는 제한적이어서 추가 검증이 필요하다.
핵심 포인트
- Agentic Thinking 프레임워크(Aaptive/Coherent Thinking)를 명시해 추론·도구 사용·디버깅을 하나의 폐회로로 통합한 점
- Qwen3.5-계열 기반의 post-training으로 에이전트·코딩 워크플로에 특화된 튜닝을 수행한 점
- 함수 호출(qwen3_coder)과 추론 파서(qwen3)를 런치 플래그로 제공하여 서빙 시 구조화된 도구 연동과 추론 트레이스 분리가 가능하다는 점
- 오픈소스(Apache-2.0)로 Pro·mini 두 변형을 동시에 공개해 사용성·확장성 선택권을 제공하는 점
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 | score | 75.3 | vs GPT-5.5: 83.4 |
| SWE-Bench Pro | score | 58.8 | vs Opus 4.7: 64.3 |
| DeepSWE | score | 33.6 | vs GPT-5.5: 70 |
| GDPval | value | 1585 | vs GPT-5.5: 1769 |
| BrowseComp | score | 83.7 | vs GPT-5.5: 84.4 |
| Toolathlon | score | 51.9 | vs GPT-5.5: 55.6 |
| GPQA Diamond | score | 90.7 | vs GPT-5.5: 93.6 |
| IFEval | score | 94.0 | — |
| Apex | score | 36.5 | — |
이미지 분석

349
LIKES
8k
DOWNLOADS
4 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.