본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

openbmb/MiniCPM5-2B-GGUF

긴 문맥 텍스트 생성, coding agent, tool-calling 및 수학·코드 reasoning2B (2,516,756,480)131K 컨텍스트Apache-2.0

MiniCPM5-2B를 GGUF로 배포해 로컬 추론과 131,072 토큰 context를 지원

학습 방식 · MiniCPM5-2B 기반의 dense Transformer에 Ultra-FineWeb·UltraX·UltraData-Code 등을 활용한 사전학습, 400B 토큰 Deep Thinking SFT, reasoning·general·agentic RL 및 Online Policy Distillation을 순차 적용했습니다.

TL;DR

MiniCPM5-2B-GGUF는 MiniCPM5-2B를 GGUF 형식으로 변환한 배포용 모델로, llama.cpp·Ollama·LM Studio에서 로컬 추론을 지원합니다. 기반 모델은 2,516,756,480개 파라미터의 dense LlamaForCausalLM이며, GQA와 131,072 토큰 context length를 사용해 긴 문서·tool-calling·coding agent 작업을 겨냥합니다. 원본 MiniCPM5-2B는 400B 토큰 규모의 Deep Thinking SFT 뒤에 reasoning·general·agentic RL과 Online Policy Distillation을 거쳤고, 공개 비교표의 평균 점수는 53.9입니다. 이 수치는 GGUF 파일 자체의 재측정값이 아니라 기반 BF16 모델 MiniCPM5-2B의 결과입니다.

핵심 포인트

  • GGUF 형식으로 제공되어 llama.cpp·Ollama·LM Studio 기반 로컬 추론 경로를 지원합니다.
  • 42개 layer와 16개 Q head·2개 KV head의 GQA 구성으로 131,072 토큰 context를 처리합니다.
  • UltraData 계열의 웹·수학·코드·SFT·RL 데이터로 사전학습과 후속 학습을 구성했습니다.
  • 기반 MiniCPM5-2B의 평균 점수는 53.9이며 LiveCodeBench v6는 69.1입니다.

벤치마크

벤치마크지표비교
Averagescore53.9기반 BF16 모델 MiniCPM5-2B의 공개 비교표 수치이며 GGUF 변환본 자체의 측정값은 아님
LiveCodeBench v6score69.1기반 MiniCPM5-2B 공개 수치이며 GGUF 변환본 자체의 측정값은 아님
AIME 2025score86.5기반 MiniCPM5-2B 공개 수치이며 GGUF 변환본 자체의 측정값은 아님
AIME 2026score86.5기반 MiniCPM5-2B 공개 수치이며 GGUF 변환본 자체의 측정값은 아님
MATH-500score94.6기반 MiniCPM5-2B 공개 수치이며 GGUF 변환본 자체의 측정값은 아님
IFBenchscore66.3기반 MiniCPM5-2B 공개 수치이며 GGUF 변환본 자체의 측정값은 아님
MMLU-Proscore70.8기반 MiniCPM5-2B 공개 수치이며 GGUF 변환본 자체의 측정값은 아님
MMLU-Reduxscore84.7기반 MiniCPM5-2B 공개 수치이며 GGUF 변환본 자체의 측정값은 아님
HLEscore8.9기반 MiniCPM5-2B 공개 수치이며 GGUF 변환본 자체의 측정값은 아님

이미지 분석

MiniCPM5-2B의 사전학습·SFT·RL+OPD 단계와 각 단계의 모델·데이터 흐름을 나타낸 학습 레시피 도식입니다.
도식은 Stable Training과 Short/Long Decay 뒤에 32K·128K Mid-Training을 거치고, 400B 토큰 Deep Thinking SFT로 MiniCPM5-2B-SFT를 만드는 순서를 담고 있습니다. 이후 Reasoning Task RL, General Task RL, Agentic RL의 결과를 Teachers로 모아 Online Policy Distillation에 투입하고, Student 경로로 SFT 모델을 연결해 최종 MiniCPM5-2B를 산출합니다. 따라서 이 GGUF 배포본의 기반 모델은 단순 SFT 체크포인트가 아니라 긴 문맥·reasoning·agent 역량을 순차적으로 추가한 최종 계열에 해당합니다.
RL+OPD 전후의 SFT baseline 점수와 추가 점수를 reasoning·coding·instruction·math·long-context·agent 영역별로 비교한 막대그래프입니다.
그래프는 SFT baseline을 파란색, RL+OPD로 얻은 증가분을 보라색으로 구분해 두 학습 단계의 점수 차이를 비교합니다. 예를 들어 AIME 2025는 66.46에서 +20.0을 더해 86.46, SWE-Bench-Verified는 29에서 +17.4를 더해 46.4로 표시되어 RL+OPD가 수학·코드 agent 평가에 추가 기여했음을 수치로 나타냅니다. 다만 그래프 하단 주석은 모든 SFT 점수가 내부 평가이며, GDPval v2의 공식 결과와 내부 결과가 함께 포함된다고 밝힙니다.

117

LIKES

7.8k

DOWNLOADS

0 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.