30B 규모 MoE로 장문·도구 사용 코드 에이전트 성능을 목표로 한 공개 모델
Cohere Labs가 공개한 30B(활성 3B) Mixture-of-Experts 기반 코드 생성용 모델로, 긴 컨텍스트(256K)·도구 호출·에이전트 흐름을 염두에 둔 SFT→RLVR 파인튜닝을 적용했다.
TL;DR
North Mini Code는 Cohere Labs가 공개한 30B(활성 3B) 규모의 코드·에이전트 특화 모델로, decoder-only Transformer 기반의 sparse Mixture-of-Experts 아키텍처를 채택했다. 모델은 128개의 전문가 중 토큰당 8개를 활성화하는 MoE 구조와 sliding-window RoPE 어텐션을 글로벌 attention과 3:1 비율로 혼합한 효율화 설계를 적용해 긴 컨텍스트(256K)와 도구 호출 워크플로를 처리하도록 설계되었다. 학습 파이프라인은 두 단계의 cascaded SFT(지도학습 파인튜닝) 후 RLVR(Reinforcement Learning with Verifiable Rewards)를 적용해 에이전트형 코드 생성 성능을 강화했다. 라우터에서 sigmoid를 적용한 뒤 top-k 선택을 수행하고, sparse 레이어 전후에 dense 레이어를 두어 표현 정렬과 안정성을 확보했다. transformers의 chat templating을 통한 함수형 도구 호출과 interleaved thinking을 공식 지원하며 vLLM과의 통합 사용 방법이 문서화되어 있다. 이로 인해 North Mini Code는 도구 기반 터미널 작업과 장문 코드 컨텍스트를 다루는 에이전트형 응용에 적합하다. 다만 공개된 벤치마크 표에서는 LiveCodeBench 등 일부 과제에서 강점을 보이지만 Qwen3.6 같은 경쟁 모델에 비해 모든 과제에서 우위에 있지는 않으며, MoE 기반 특성상 배포·추론 환경(특히 활성화·라우팅 비용)과 호환성(vLLM 권장 등)을 고려해야 한다.
핵심 역량
- 프로그래밍 코드 생성 및 수정(파이썬 등 텍스트 기반 코드 출력)
- 도구 호출(function/tool use)과 터미널 상호작용을 포함한 에이전트형 워크플로 처리
- 장문 컨텍스트(최대 256K)를 필요로 하는 코드·문서 상호참조
- interleaved thinking(생각문장)과 도구 출력의 교차 흐름을 지원하는 대화형 응답 생성
강점
- 긴 컨텍스트(256K)와 대규모 MoE 구조로 복잡한 코드·세션 문맥을 유지하며 도구 기반 작업 흐름을 처리할 수 있다는 점
- 도구 호출(chat templating)과 interleaved thinking을 공식 지원해 에이전트형 파이프라인에 쉽게 통합 가능하다는 점
훈련 방식
원모델 아키텍처에 대해 two-stage cascaded Supervised Fine-Tuning(SFT) 후 Reinforcement Learning with Verifiable Rewards(RLVR)을 적용해 에이전트형 코드 생성 역량을 집중적으로 향상시켰다.
알아두면 좋은 것
- 모델 아키텍처는 decoder-only Transformer 기반의 sparse Mixture-of-Experts로, 128개 전문가 중 토큰당 8개가 활성화된다.
- 어텐션은 RoPE 기반의 sliding-window와 포지셔널 임베딩 없는 global attention을 3:1 비율로 교차 배치해 긴 문맥 처리와 글로벌 참조를 병행한다.
- 후처리된 훈련 파이프라인은 두 단계의 cascaded SFT(지도학습 파인튜닝) 후 RLVR을 적용해 에이전트 코딩 성능을 개선한 방식이다.
- 컨텍스트 길이 256K, 최대 출력 64K를 지원하며 transformers 채팅 템플릿과 vLLM을 통한 배포 방법을 권장한다.
기술적 특징
- 모델 구조는 decoder-only Transformer 기반의 sparse Mixture-of-Experts로 설계되었다. 전체적으로는 30B 파라미터지만 MoE 설계로 활성화된 파라미터는 줄어들어 토큰당 연산을 제어하고 대용량 모델의 표현력을 확보했다.
- 피드포워드 블록은 128개의 전문가로 구성되며 토큰당 8개의 전문가가 활성화된다. 전문가 내부 FFN은 SwiGLU 활성화를 사용해 표현력을 높이고, 라우터는 top-k 선택 전에 sigmoid를 적용해 전문가 선택의 스케일 특성을 조정한다.
- 어텐션은 sliding-window attention(로테리 포지셔널 RoPE 적용)과 포지셔널 임베딩 없는 global attention을 3:1 비율로 섞어 배치했다. 이 구성은 지역적 문맥을 효율적으로 처리하면서도 필요 시 전역적 참조를 허용해 긴 코드 세션과 터미널 로그를 다루는 데 유리하다.
- 아키텍처 전/후단에 단일 dense 레이어를 두어 sparse MoE 레이어와의 인터페이스를 안정화했다. 이 레이어는 dense→sparse 전환 시의 표현 정렬과 수렴 거동 개선에 기여하도록 배치되었다.
- 학습 파이프라인은 cascaded SFT 후 RLVR 적용으로 구성되어 에이전트형 행동(도구 호출, 터미널 상호작용 등)에 대한 보상 지향적 미세조정이 반영되었다. 이로 인해 단순 생성 성능뿐 아니라 도구 사용·상태 관리 측면의 실전 성능이 강조되었다.
차별점
- 대규모 MoE(128 experts, 8 active)를 코드 에이전트 용도로 공개 가중치로 제공한 점
- 슬라이딩 윈도우 RoPE와 포지셔널 임베딩 없는 global attention을 3:1 비율로 혼합한 어텐션 설계
- interleaved thinking과 Transformers chat templating 기반의 도구 호출 흐름을 공식적으로 권장·지원하는 점
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Terminal-Bench v2 | score | 36.0 | — |
| Terminal-Bench Hard | score | 31.1 | — |
| SWE-Bench Verified | score | 67.6 | — |
| SWE-Bench Pro | score | 40.2 | — |
| SciCode | score | 38.2 | — |
| LiveCodeBench v6 | score | 70.3 | — |
이미지 분석

487
Likes
24.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.