Agentic Thinking으로 장기 작업을 실행하는 Nex-N2-mini 공개
Agentic Thinking 프레임워크와 function-calling·reasoning-parser를 결합해 도구 호출, 코드 실행, 장기 워크플로우 성능을 강화한 Qwen3.5 기반 경량 Nex-N2 변형이다.
TL;DR
Nex-N2-mini는 Nex-AGI가 공개한 에이전트형 언어 모델 계열의 경량 변형으로, Qwen3.5-35B-A3B-Base를 기반으로 후처리(post-trained)되어 에이전트 워크플로우와 코딩 작업에 초점을 맞췄다. 모델 계열은 요구 이해→계획→코드 실행→평가를 하나의 반복 루프로 연결하는 Agentic Thinking을 중심으로 설계되어, 단순 실행과 심층 추론을 상황에 맞게 조절하는 Adaptive Thinking과 일관된 추론 규범을 유지하는 Coherent Thinking을 결합했다. 이 모델은 명시적 reasoning-trace 출력과 qwen3 규격의 reasoning-parser, 구조화된 function-calling(qwen3_coder)을 지원해 도구 호출 기반 워크플로우에서 추적성·디버깅·자동화가 가능하다. 배포 측면에서 sglang 포크와 Docker 이미지를 통해 권장 서빙 구성을 제공하며, 권장 샘플링 파라미터(temperature 0.7, top_p 0.95, top_k 40)를 제시한다. Nex-N2-mini는 BrowseComp 74.1, Terminal-Bench 60.7, GDPval 1402 등 실무형 벤치마크에서 경쟁력 있는 점수를 기록했고, Pro 변형은 대규모 모델 성능과 레이턴시 트레이드오프에서 상위권에 위치한다. 따라서 Nex-N2-mini는 도구 호출과 코드 실행을 포함한 장기 워크플로우에서 추적 가능한 실행 흐름과 오픈소스 배포 편의성을 제공하지만, Pro 대비 절대 성능은 낮고 일부 벤치에서는 최상위 모델보다 점수가 낮아 성능·지연 요구에 따른 선택이 필요하다. 서빙은 sglang 기반 멀티노드·TP 설정을 권장하며, 대규모 사용 시 Pro 변형과 전용 인프라 구성이 요구된다.
핵심 역량
- 명시적 추론(trace) 출력으로 사고 과정과 최종 응답을 분리해 추적 가능성 제공
- 구조화된 function-calling을 통한 외부 도구·API 실행 및 결과 통합
- 코드 생성 및 터미널 명령 실행을 포함한 에이전트형 코딩 워크플로우 지원
- 검색·브라우징 기반 의사결정(검색-기반 도구 호출)과 멀티모달(image-text-to-text) 입력 처리
- 대화형 응답 생성 및 연속적 계획·반복(descision-and-iterate) 수행
강점
- 에이전트형 워크플로우와 코딩 수행능력에 초점을 맞춰 성능을 개선했으며, Nex-N2-mini의 주요 벤치마크 점수로 BrowseComp 74.1, Terminal-Bench 60.7, GDPval 1402가 보고되어 실무적 에이전트 작업에 적합한 성능을 보인다.
- Apache-2.0 라이선스와 Docker/sglang 예시를 통한 배포 가이드 제공으로 실무 도입과 통합이 용이하다.
훈련 방식
Qwen3.5 시리즈 기반 모델에 대한 post-training으로 에이전트·코딩·도구 호출 역량을 특화(post-trained on Qwen3.5 series; Pro: Qwen3.5-397B-A17B, mini: Qwen3.5-35B-A3B-Base).
알아두면 좋은 것
- Agentic Thinking 프레임워크(Adaptive Thinking + Coherent Thinking)를 통해 요구 이해, 계획, 코드 구현, 환경 실행, 평가 및 디버깅을 하나의 반복 루프로 연결한다.
- 두 가지 변형으로 제공되며 Pro는 Qwen3.5-397B-A17B 기반, mini는 Qwen3.5-35B-A3B-Base 기반으로 후처리(post-trained)되어 성능·지연의 트레이드오프를 선택할 수 있다.
- 오픈소스(Apache-2.0)로 배포되며 sglang 포크와 nexagi/sglang:v0.5.12 Docker 이미지를 통해 권장 서빙 구성을 제공한다.
- function-calling과 reasoning-parser(qwen3 규격)를 지원하며, 권장 샘플링 파라미터(temperature 0.7, top_p 0.95, top_k 40)를 제시한다.
기술적 특징
- Agentic Thinking 프레임워크를 통해 요구 이해→계획→코드 생성→환경 실행→평가→디버깅의 순환을 하나의 루프로 통합했다. 이 구조는 모델이 간단한 작업은 빠르게 실행하고 중요한 결정은 더 깊게 사고하도록 Adaptive Thinking과 Coherent Thinking으로 역할을 분리해 안정적 반복 개선을 목표로 한다.
- Qwen3.5 시리즈 기반의 post-training으로 에이전트·코딩 특화 역량을 확보했다. Nex-N2-Pro는 Qwen3.5-397B-A17B를, Nex-N2-mini는 Qwen3.5-35B-A3B-Base를 기반으로 성능·지연의 균형을 맞추었다.
- 명시적 reasoning-trace 출력과 독립 파싱(qwen3 reasoning-parser)을 지원해 모델의 사고 과정과 최종 응답을 분리할 수 있다. 이 접근은 도구 호출 결정·디버깅·인간 검토에서 추적 가능성을 높인다.
- 구조화된 function-calling(qwen3_coder) 인터페이스를 통해 모델이 외부 API·툴을 호출하고 응답을 통합하도록 설계되었다. README의 서빙 플래그와 예시는 툴 기반 에이전트 워크플로우에서 함수 호출 파이프라인을 바로 구성할 수 있게 한다.
- 서빙 최적화를 위해 sglang 포크와 mamba-scheduler-strategy 옵션을 권장하고, 멀티노드·템서 병렬(tp) 설정 예시를 제공해 대규모 모델(Pro)과 경량 모델(mini)에 맞춘 배포·추론 토폴로지를 제시한다.
차별점
- 에이전트 전용 'Agentic Thinking' 설계(Adaptive + Coherent)로 사고 깊이와 실행 빈도를 상황별로 조절한다.
- 명시적 reasoning-trace와 별도 파서를 통해 추론 과정 추적·검증이 가능하며, function-calling 파서를 함께 제공해 도구 기반 워크플로우에 바로 연계된다.
- Qwen3.5 시리즈 기반의 두 가지 변형(Pro/mini)을 동시 공개해 성능·레턴시 요구에 따라 선택할 수 있게 했다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| BrowseComp | score | 74.1 | vs GPT-5.5: 84.4 |
| GDPval | score | 1402 | vs GPT-5.5: 1769 |
| Toolathlon | score | 33.3 | vs GPT-5.5: 55.6 |
| Terminal-Bench 2.1 | score | 60.7 | vs GPT-5.5: 83.4 |
| SWE-Bench Pro | score | 50.2 | vs Opus 4.7: 64.3 |
| DeepSWE | score | 8.0 | vs GPT-5.5: 70 |
| GPQA Diamond | score | 82.6 | vs Opus 4.7: 94.2 |
| IFEval | score | 89.1 | vs Kimi-K2.6: 94.5 |
| WideSearch | score | 62.0 | — |
이미지 분석

248
Likes
13.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.