에이전트 루프와 코드 실행에 최적화된 Qwen3.5 기반 오픈소스 LLM
Qwen3.5-기반으로 post-training한 에이전트 지향 대형 언어모델로, 함수 호출·추론 트레이스·터미널 실행 등 장기 워크플로에서 우수한 코딩·에이전트 성능을 목표로 한다.
TL;DR
Nex-N2-Pro는 Qwen3.5 계열을 기반으로 post-training을 거쳐 에이전트 워크플로와 코딩 과제에 특화된 대형 언어모델이다. 모델은 에이전트적 사고(Agentic Thinking) 프레임워크를 통해 요구 파악, 계획, 코드 구현, 환경 피드백, 평가·디버깅을 하나의 폐회로로 연결해 장기 과제와 도구 연동을 원활히 수행하도록 설계되었다. 핵심 기술로는 Adaptive Thinking(간단한 작업은 빠르게 실행하고 중요 결정은 심층 추론)과 Coherent Thinking(다양한 과제와 모달리티에 걸쳐 일관된 추론 패턴 유지)이 있으며, 함수 호출 파싱(qwen3_coder)과 추론 트레이스 분리(qwen3)를 런타임 플래그로 제공해 구조화된 도구 연동과 디버깅을 지원한다. README는 Nex-N2-Pro가 Qwen3.5-397B-A17B 기반임을 명시하고 Terminal-Bench 2.1: 75.3, GDPval: 1585 등 여러 벤치마크 수치를 제시해 코딩·장기 계획 평가에서 높은 성능을 보고했다. 그 결과 Nex-N2-Pro는 도구 호출·터미널 실행·장기 계획을 포함한 실무적 에이전트 워크플로에서 실용적 이점을 제공한다. 트레이드오프로는 대형 모델 특성상 H100급 다중 GPU 환경과 sglang 기반 서빙 구성이 권장되며, README에 명시된 기술적 세부(학습 기법 세부, 컨퍼런스급 벤치마크와의 직접 비교 분석)는 제한적이어서 추가 검증이 필요하다.
핵심 역량
- 도구 호출을 포함한 function-calling 출력 생성 및 파싱을 통해 외부 API/도구 연동을 지원한다
- 추론 트레이스(reasoning traces)를 별도로 내보내 의사결정 근거와 단계별 사고를 노출한다
- 터미널 기반 코드 실행 및 장기 계획을 요구하는 코딩·에이전트 워크플로를 지속적으로 수행한다
- 멀티모달(이미지-텍스트) 입력을 바탕으로 생성 작업을 보조하는 기능을 태그·README로 지원한다
강점
- 코딩 성능: Terminal-Bench 2.1에서 75.3을 기록해 개발·터미널 중심 워크플로에서 경쟁력 있는 성능을 보였다.
- 장기·에이전트 과제 성능: GDPval 1585로 장기 의사결정·환경 상호작용 평가에서 높은 점수를 기록했다.
- 오픈소스·배포 가이드: Apache-2.0 라이선스와 사전 구축된 sglang Docker 이미지를 제공해 프로덕션 통합이 용이하다.
훈련 방식
Qwen3.5 계열(Qwen3.5-397B-A17B 기반)을 가져와 에이전트적 워크플로와 코딩 성능 강화를 목적으로 post-training을 수행함.
알아두면 좋은 것
- 모델은 Qwen3.5 시리즈 기준으로 post-training되었으며 Pro( Qwen3.5-397B-A17B 기반)와 mini( Qwen3.5-35B 기반) 변형을 공개했다.
- 서빙을 위해 Nex-AGI가 커스텀한 sglang 포크와 docker 이미지(nexagi/sglang:v0.5.12)를 권장하며 다중 노드·텐서 병렬(tp) 설정 예시를 제공한다.
- 명시적 함수 호출(qwen3_coder)과 추론 파서(qwen3)를 통해 reasoning trace와 function-calling을 분리해 처리하는 런타임 통합을 지원한다.
- Apache-2.0 라이선스로 공개되어 상용·연구 목적의 통합이 가능하다.
기술적 특징
- Agentic Thinking 프레임워크로 사고와 실행을 폐회로로 연결한다. 모델은 Adaptive Thinking으로 간단한 작업은 빠르게 실행하고 중요한 결정에 대해선 깊은 추론을 수행하며, Coherent Thinking으로 다양한 모달리티와 에이전트 작업 전반에 일관된 추론 패턴을 유지해 능력 이전을 안정화했다.
- 기반 모델은 Qwen3.5 계열을 사용하고 post-training으로 에이전트·코딩 역량을 강화했다. README에 Pro는 Qwen3.5-397B-A17B 기반, mini는 Qwen3.5-35B 기반으로 명시되어 있어 확장성·지연 시간별 변형을 제공한다.
- 런타임 통합을 통해 함수 호출과 추론 트레이스를 분리 처리한다. --tool-call-parser qwen3_coder와 --reasoning-parser qwen3 플래그를 통해 구조화된 함수 호출을 파싱하고 추론 근거를 별도로 추출해 도구 연동과 디버깅을 용이하게 한다.
- 대규모 서빙을 위해 sglang 포크와 mamba 스케줄러 전략을 권장한다. README는 다중 노드(tensor parallel tp 16) 및 mamba-scheduler-strategy extra_buffer 설정을 제시해 대형 모델을 H100 클러스터에서 안정적으로 운영하도록 설계되었음을 나타낸다.
차별점
- Agentic Thinking 프레임워크(Aaptive/Coherent Thinking)를 명시해 추론·도구 사용·디버깅을 하나의 폐회로로 통합한 점
- Qwen3.5-계열 기반의 post-training으로 에이전트·코딩 워크플로에 특화된 튜닝을 수행한 점
- 함수 호출(qwen3_coder)과 추론 파서(qwen3)를 런치 플래그로 제공하여 서빙 시 구조화된 도구 연동과 추론 트레이스 분리가 가능하다는 점
- 오픈소스(Apache-2.0)로 Pro·mini 두 변형을 동시에 공개해 사용성·확장성 선택권을 제공하는 점
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench 2.1 | score | 75.3 | vs GPT-5.5: 83.4 |
| SWE-Bench Pro | score | 58.8 | vs Opus 4.7: 64.3 |
| DeepSWE | score | 33.6 | vs GPT-5.5: 70 |
| GDPval | value | 1585 | vs GPT-5.5: 1769 |
| BrowseComp | score | 83.7 | vs GPT-5.5: 84.4 |
| Toolathlon | score | 51.9 | vs GPT-5.5: 55.6 |
| GPQA Diamond | score | 90.7 | vs GPT-5.5: 93.6 |
| IFEval | score | 94.0 | — |
| Apex | score | 36.5 | — |
이미지 분석

349
Likes
8k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.