openbmb/MiniCPM5-1B
MiniCPM5-1B는 131k 토큰 컨텍스트와 Think/No-Think 모드를 동일 체크포인트로 제공하며 RL+OPD를 통해 수학·코드·지시이행 능력을 개선한 1B급 공개 LLM이다.
학습 방식 · 모델은 base 학습, mid-training, post-training의 세 단계로 훈련되었고 각 단계는 UltraData 계층형 코퍼스(예: Ultra-FineWeb, UltraData-Math, UltraData-SFT-2605)를 사용해 목적별 역량을 강화했다. SFT 단계에서는 deep-thinking과 hybrid-thinking 각각 200B 토큰을 투입해 초기 추론 능력을 확립했으며 이후 도메인별 RL 교사들을 구축해 수학·코드·QA·쓰기 등에서 전문 신호를 학습시켰다. 최종적으로 On-Policy Distillation(OPD)을 적용해 RL 교사들의 정책을 학생 모델로 역전파하는 방식으로 성능과 응답 제어를 통합했다.
TL;DR
MiniCPM5-1B는 1.08B 파라미터의 온디바이스 친화적 Causal LLM으로 131,072 토큰의 장기 컨텍스트를 네이티브로 지원하고 동일 체크포인트에서 Think/No-Think 모드를 전환할 수 있다. 훈련은 UltraData 계층형 코퍼스 기반의 base·mid·post 단계로 이루어졌으며 SFT(각 200B tokens) 후 도메인별 RL 교사를 만들고 On-Policy Distillation(OPD)을 통해 이들 교사의 정책을 학생 모델로 역전파해 수학·코드·지시이행 성능을 개선했다. README에 따르면 RL+OPD 적용으로 평균 점수는 +16 포인트, 최대 토큰 히트 비율은 -29 퍼센트포인트 개선이 관찰되었고 다양한 배포 포맷과 백엔드를 공식 지원해 로컬 에이전트·도구 호출 워크플로에 바로 적용 가능하다.
핵심 포인트
- 동일 체크포인트에서 Think/No-Think 모드를 전환하는 하이브리드 추론 템플릿을 제공해 별도 모델 없이 응답 깊이를 제어할 수 있다. 이 설계는 운영 복잡도를 낮추면서 에이전트와 도구 호출 워크플로에서 즉시 활용 가능한 이점을 제공한다. 결과적으로 하나의 모델로 범용성과 고난도 추론을 병행할 수 있게 되었다.
- 네이티브 131k 토큰 컨텍스트 지원과 GQA 어텐션 구성으로 긴 문서 작업에서 경쟁 우위를 확보했으며, 이를 로컬·온디바이스 배포 제약에 맞춰 최적화했다. 긴 컨텍스트를 실환경에서 다루기 위한 메모리·연산 절감 설계가 핵심 차별요소이다. 따라서 문서 기반 태스크와 장기 대화 유지에서 유리하게 작동한다.
- RL+OPD 파이프라인을 통해 도메인별 RL 교사들의 성능을 학생 모델로 역전파하면서 평균 점수와 과다응답률을 동시에 개선한 점이 실무적 차별점이다. reverse KL을 활용한 OPD 설계는 추가 데이터 큐레이션 없이 교사 능력을 통합하는 효과를 냈다. 이로 인해 수학·코드·지시이행 등 특정 영역에서 실측 개선이 보고되었다.
- 동일 체크포인트에서 Think/No-Think 모드를 전환할 수 있어 하나의 모델로 빠른 어시스턴트와 신중한 추론자 역할을 모두 수행할 수 있다. 이 설계는 운영 복잡도를 낮추면서도 태스크별 응답 품질을 조절할 수 있게 한다. 에이전트 및 도구 호출 워크플로에서 실용성이 높다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| RL+OPD average gain | average score delta | ↑16 points | — |
| RL+OPD overlong response rate | max-token hit share delta | ↓29 percentage points | — |
이미지 분석




977
LIKES
408.3k
DOWNLOADS
4 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.