openbmb/MiniCPM5-2B
텍스트 생성, 긴 문맥 이해, 코드·수학 추론, tool use 및 agent 작업2,516,756,480131K 컨텍스트apache-2.0
RL과 OPD를 거친 2B 모델로 131,072 토큰 문맥과 코딩·수학·Agent 작업을 지원
학습 방식 · MiniCPM5-2B-Base를 Stable Training·Short Decay 4K·Long Decay 32K→128K→512K로 사전 학습하고, 32K·128K Mid-Training과 400B 토큰 Deep Thinking SFT를 거친 뒤 Reasoning Task RL·General Task RL·Agentic RL 및 Online Policy Distillation(OPD)을 적용했습니다.
TL;DR
MiniCPM5-2B는 2,516,756,480개 파라미터를 사용하는 dense 2B Causal Language Model로, LlamaForCausalLM 구조를 기반으로 합니다. 131,072 토큰 문맥과 GQA를 지원하며, SFT 이후 Reasoning Task·General Task·Agentic RL을 거쳐 RL과 Online Policy Distillation(OPD)을 적용한 최종 checkpoint입니다. 로컬 assistant, coding agent, tool-use workflow처럼 제한된 자원에서 추론·코딩·긴 문맥 처리가 필요한 환경을 겨냥하며, README 비교군에서 평균 점수 53.9를 기록했습니다.
핵심 포인트
- 2,516,756,480개 파라미터와 42개 레이어를 사용하는 LlamaForCausalLM 기반 dense 2B 모델입니다.
- GQA에서 Q 헤드 16개와 KV 헤드 2개를 사용하고 131,072 토큰 native context를 지원합니다.
- 400B 토큰 Deep Thinking SFT 뒤에 세 종류의 RL과 Online Policy Distillation을 연결했습니다.
- 비교군 평균 점수 53.9로 2B급 모델과 일부 4B급 모델을 앞섰으며 코딩·수학·긴 문맥에서 강점을 보였습니다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| Average | score | 53.9 | README 비교군에서 가장 높은 평균 점수이며, 비교 대상으로 제시된 모델의 최고 점수는 51.1입니다. |
| LiveCodeBench v6 | score | 69.1 | — |
| AIME 2025 | score | 86.5 | — |
| MATH-500 | score | 94.6 | — |
| IFBench | score | 66.3 | — |
| MMLU-Pro | score | 70.8 | — |
이미지 분석


209
LIKES
13
DOWNLOADS
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.