3B 규모로 Qwen3.5·Gemma4를 넘어선 에이전트형 LLM
Looped Transformer 구조와 SFT+RL 보상 설계를 결합해 3B 파라미터 규모에서 강한 에이전트·추론·코드 성능을 달성한 모델이다.
TL;DR
Nanbeige4.2-3B는 Nanbeige4.2-3B-Base를 바탕으로 Looped Transformer 아키텍처와 n-gram 임베딩, LoopSplit·mHC 깊이 어텐션 등의 구조적 개선을 적용해 3B non-embedding 파라미터로도 강한 에이전트 행동과 추론 성능을 확보한 모델이다. 훈련 파이프라인은 SFT로 다양한 실제·합성 환경을 확보한 뒤 RL에서 outcome과 process 보상을 결합해 행동의 완결성과 안정성을 동시에 개선하는 방식으로 구성되어 있다. README의 벤치마크 표와 성능 그래프는 Pinch-Bench-V2 74.7, GPQA-Diamond 87.4, HMMT-Feb-2026 82.8 등 여러 평가에서 Qwen3.5-9B·Gemma4-12B보다 높은 점수를 기록했음을 보여준다. 모델은 로컬 배포와 양자화 경로를 명시해 제한적 리소스 환경에서 실용적으로 운영할 수 있고 Apache-2.0 라이선스를 따른다.
핵심 역량
- 멀티스텝 도구 사용과 에이전트적 행동을 통해 외부 리소스 호출과 플래닝을 연속적으로 수행할 수 있다. 입력 템플릿의 enable_thinking·preserve_thinking 플래그를 활용해 현재 턴 또는 이전 사고를 보존하면서 일관된 도구 호출을 이어간다. 이로 인해 복잡한 오피스 업무나 연속적 코드 작업에서 상태 유지를 통해 작업 완결도를 개선할 수 있다.
- 수학적·과학적·코딩 추론에서 높은 정확도를 보이며 GPQA, HMMT, LiveCodeBench와 같은 추론·코드 벤치마크에서 상위 성능을 기록했다. 모델 내부의 Looped Transformer와 n-gram 임베딩이 긴 의존성을 포착해 복잡한 추론 단계를 더 안정적으로 처리한다. reasoning 모드에서는 추천된 낮은 온도와 큰 max_new_tokens 설정으로 장기 추론을 수행할 수 있다.
- 경량화된 크기(3B non-embedding 파라미터)로 로컬 배포와 양자화 후 실행이 용이하며 llama.cpp·ollama·vLLM 같은 다양한 로컬 런타임과 호환된다. README에서 GGUF 변환 및 Q4_K_M 양자화 과정을 안내하고 있어 제한된 GPU 자원 환경에서도 추론이 가능하다. 로컬 배포 시 메모리 활용 파라미터와 텐서 병렬 설정을 조정해 효율적인 운영이 가능하다.
강점
- 동일하거나 더 큰 파라미터의 모델들과 비교해 에이전트·코드·추론 벤치마크에서 일관되게 높은 점수를 보이며 3B 규모에서 효율적인 성능 대 비용 비율을 확보하고 있다. README 표에서는 Qwen3.5-9B와 Gemma4-12B를 포함한 모델들보다 여러 평가에서 우위를 보인 수치가 제시되어 성능 우위를 실증적으로 뒷받침한다. 또한 로컬 배포와 양자화 경로를 명시해 실제 운영 환경에 적용하기 쉬운 편의성을 함께 제공한다.
훈련 방식
Nanbeige4.2-3B는 Nanbeige4.2-3B-Base를 기반으로 Supervised Fine-Tuning을 통해 다양한 실제·합성 환경에서 학습 데이터를 확장하고 이후 강화학습 단계에서 outcome 보상과 process 보상을 결합해 소규모 모델의 안정성과 행동 품질을 개선했다.
알아두면 좋은 것
- 모델은 Looped Transformer 아키텍처를 사용해 레이어 재사용으로 표현 용량을 늘리며 3B non-embedding 파라미터로 강한 에이전트·추론 성능을 달성했다. README는 LoopSplit, mHC with depth attention, concatenated n-gram embeddings 같은 아키텍처 개선을 명시하고 있어 구조적 차별화가 분명하다. 향후 Nanbeige4.5에 동일한 구성요소가 포함될 예정이라고 명시했다.
- 훈련 과정은 SFT 단계에서 실제 환경 통합과 대규모 환경 합성을 통해 작업 다양성을 늘리고, RL 단계에서는 outcome과 process 보상을 결합해 소규모 모델의 안정성을 확보했다고 기록되어 있다. 데이터 품질을 위해 trajectory·turn 레벨에서 필터링과 테스크별 루브릭 평가를 적용했다고 명시되어 있다. OfficeQA-pro 같은 어려운 문서 기반 평가에서는 원문 PDF를 모두 제공하는 엄격한 설정을 사용했다.
- Inference 가이드에서 에이전트·툴 사용 시 max_new_tokens 65,536, reasoning·chat 용도에 max_new_tokens 131,072를 권장하며 temperature와 top_p/top_k 기본값을 제시했다. 토크나이저는 chat template과 reasoning 관련 configurable 옵션(enable_thinking, preserve_thinking)을 제공해 대화·툴 사용 시 동작 제어가 가능하다. HuggingFace, vLLM, llama.cpp, ollama 등 여러 배포 경로와 양자화 예시를 포함하고 있다.
- 라이선스는 Apache-2.0이며 사용 언어는 영어와 중국어를 지원한다고 명시되어 있다. 모델은 Nanbeige4.2-3B-Base를 기반으로 파인튜닝되었고 HuggingFace transformers와 safetensors 포맷으로 배포된다. README에 개발자 연락처와 이슈 리포트 채널이 포함되어 있다.
기술적 특징
- Looped Transformer 구조는 동일한 Transformer 레이어를 반복적으로 재사용해 파라미터 수를 크게 늘리지 않고도 더 깊은 표현력을 확보한다. 이 방식은 작은 모델 크기에서 높은 표현 용량을 얻도록 설계되어 로컬 배포 제약을 가진 환경에서도 복잡한 태스크를 다룰 수 있게 한다. 반복 구조의 제어를 위해 LoopSplit과 mHC with depth attention 같은 추가 기법이 결합되어 있다.
- LoopSplit은 루프드 연산을 분할해 서로 다른 경로에서 특화된 표현을 학습하도록 하고 mHC with depth attention은 레이어 깊이에 따라 어텐션 가중을 달리 적용해 계층적 문맥을 포착한다. 이 조합은 루프드 구조의 반복성으로 발생할 수 있는 표현의 동질성을 완화해 다양한 태스크에서의 분화된 기능을 가능하게 한다. 결과적으로 에이전트 행동과 추론력을 동시에 높이는 설계 효과가 발생한다.
- concatenated n-gram embeddings는 단일 토큰 임베딩에 인접 n-그램 정보를 결합해 입력 표현을 풍부하게 만들며 복잡한 코드·수학적 표현의 구조적 특성을 더 잘 반영한다. 이 임베딩은 긴 의존성이나 구조적 패턴이 중요한 태스크에서 성능 개선으로 연결되며 reasoning 및 code-agent 벤치마크에서의 우수한 점수와 연결된다. 임베딩 단계에서의 정보량 증대는 작은 모델에서 특히 효율적인 성능 상승을 이끈다.
- 훈련 파이프라인은 SFT로 태스크 다양성과 데이터 품질을 확보한 다음 RL 단계에서 outcome과 process 보상을 결합해 행동의 완결성과 안정성을 동시에 개선하도록 구성되어 있다. 데이터 필터링은 trajectory와 turn 레벨에서 수행되어 노이즈를 줄이고 평가 기반 테스트 케이스와 루브릭을 병행해 품질을 검증한다. 이로 인해 에이전트적 작업 수행 중 일관된 행동과 낮은 붕괴 확률을 확보했다.
차별점
- Looped Transformer 아키텍처로 동일 파라미터 예산에서 더 높은 표현 용량을 확보해 3B 규모에서 대형 모델에 필적하는 성능을 달성했다. 이 구조는 레이어 재사용과 추가적 깊이 제어 기법을 결합해 에이전트 행동에서의 복잡한 플래닝과 도구 사용을 지원한다. 결과적으로 로컬 배포 가능성과 높은 에이전트 성능을 동시에 만족시킨다.
- 훈련에서 SFT 단계의 대규모 환경 합성 및 실제 환경 통합과 RL의 outcome·process 보상 결합을 통해 행동 품질과 안정성을 동시에 확보했다. 특히 trajectory·turn 레벨 필터링과 루브릭 기반 검증을 통해 데이터 품질을 관리해 평가 신뢰도를 높였다. 이러한 파이프라인은 소규모 모델이 멀티스텝 작업에서 일관된 성능을 내도록 하는 핵심 요소이다.
- 로컬 실행 친화적 배포 경로(Transformers safetensors, llama.cpp GGUF 변환, Ollama MLX/GGUF, vLLM 서빙 예시)를 README에 상세히 제공해 실제 운영까지의 기술적 진입 장벽을 낮추었다. 양자화 예시(Q4_K_M)와 권장 메모리 설정을 포함해 제한된 하드웨어에서도 실용적 배포가 가능하다. 이로 인해 엔지니어가 프로토타입을 신속히 제작할 수 있다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Pinch-Bench-V2 | score | 74.7 | vs Qwen3.5-9B: 68.2 |
| GDPval rubrics | score | 74.3 | vs Gemma4-12B: 68.5 |
| GPQA-Diamond | accuracy | 87.4 | vs Qwen3.5-9B: 81.7 |
| HMMT-Feb-2026 | score | 82.8 | vs Qwen3.5-9B: 69.6 |
| Claw-Eval | pass | 52.2 | vs Qwen3.5-9B: 47.1 |
| SWE-Bench Verified | score | 63.6 | vs Qwen3.5-9B: 53.1 |
이미지 분석

582
Likes
24.5k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.