본문으로 건너뛰기

트렌딩 - GitHub 인기 레포 & HuggingFace 모델

openbmb/MiniCPM5-1B

이 모델은 장문 텍스트 생성과 대화형 어시스턴트, 도구 호출 기반 에이전트 워크플로, 코드 생성 및 복잡한 추론 문제 해결을 목표로 한다. Think 모드와 No-Think 모드 전환을 통해 응답의 깊이와 산출 길이를 제어하며, 도메인별 RL 교사들을 통합한 OPD를 통해 특화된 능력을 전달받았다. 긴 컨텍스트(131,072 토큰)를 네이티브로 지원해 문서 이해와 장기 문맥 유지가 필요한 태스크에서 활용되도록 설계되었다.1,080,632,832131K 컨텍스트apache-2.0

MiniCPM5-1B는 131k 토큰 컨텍스트와 Think/No-Think 모드를 동일 체크포인트로 제공하며 RL+OPD를 통해 수학·코드·지시이행 능력을 개선한 1B급 공개 LLM이다.

학습 방식 · 모델은 base 학습, mid-training, post-training의 세 단계로 훈련되었고 각 단계는 UltraData 계층형 코퍼스(예: Ultra-FineWeb, UltraData-Math, UltraData-SFT-2605)를 사용해 목적별 역량을 강화했다. SFT 단계에서는 deep-thinking과 hybrid-thinking 각각 200B 토큰을 투입해 초기 추론 능력을 확립했으며 이후 도메인별 RL 교사들을 구축해 수학·코드·QA·쓰기 등에서 전문 신호를 학습시켰다. 최종적으로 On-Policy Distillation(OPD)을 적용해 RL 교사들의 정책을 학생 모델로 역전파하는 방식으로 성능과 응답 제어를 통합했다.

TL;DR

MiniCPM5-1B는 1.08B 파라미터의 온디바이스 친화적 Causal LLM으로 131,072 토큰의 장기 컨텍스트를 네이티브로 지원하고 동일 체크포인트에서 Think/No-Think 모드를 전환할 수 있다. 훈련은 UltraData 계층형 코퍼스 기반의 base·mid·post 단계로 이루어졌으며 SFT(각 200B tokens) 후 도메인별 RL 교사를 만들고 On-Policy Distillation(OPD)을 통해 이들 교사의 정책을 학생 모델로 역전파해 수학·코드·지시이행 성능을 개선했다. README에 따르면 RL+OPD 적용으로 평균 점수는 +16 포인트, 최대 토큰 히트 비율은 -29 퍼센트포인트 개선이 관찰되었고 다양한 배포 포맷과 백엔드를 공식 지원해 로컬 에이전트·도구 호출 워크플로에 바로 적용 가능하다.

핵심 포인트

  • 동일 체크포인트에서 Think/No-Think 모드를 전환하는 하이브리드 추론 템플릿을 제공해 별도 모델 없이 응답 깊이를 제어할 수 있다. 이 설계는 운영 복잡도를 낮추면서 에이전트와 도구 호출 워크플로에서 즉시 활용 가능한 이점을 제공한다. 결과적으로 하나의 모델로 범용성과 고난도 추론을 병행할 수 있게 되었다.
  • 네이티브 131k 토큰 컨텍스트 지원과 GQA 어텐션 구성으로 긴 문서 작업에서 경쟁 우위를 확보했으며, 이를 로컬·온디바이스 배포 제약에 맞춰 최적화했다. 긴 컨텍스트를 실환경에서 다루기 위한 메모리·연산 절감 설계가 핵심 차별요소이다. 따라서 문서 기반 태스크와 장기 대화 유지에서 유리하게 작동한다.
  • RL+OPD 파이프라인을 통해 도메인별 RL 교사들의 성능을 학생 모델로 역전파하면서 평균 점수와 과다응답률을 동시에 개선한 점이 실무적 차별점이다. reverse KL을 활용한 OPD 설계는 추가 데이터 큐레이션 없이 교사 능력을 통합하는 효과를 냈다. 이로 인해 수학·코드·지시이행 등 특정 영역에서 실측 개선이 보고되었다.
  • 동일 체크포인트에서 Think/No-Think 모드를 전환할 수 있어 하나의 모델로 빠른 어시스턴트와 신중한 추론자 역할을 모두 수행할 수 있다. 이 설계는 운영 복잡도를 낮추면서도 태스크별 응답 품질을 조절할 수 있게 한다. 에이전트 및 도구 호출 워크플로에서 실용성이 높다.

벤치마크

벤치마크지표비교
RL+OPD average gainaverage score delta↑16 points
RL+OPD overlong response ratemax-token hit share delta↓29 percentage points

이미지 분석

레이더 플롯은 MiniCPM5-1B와 비교 베이스라인들 사이의 도메인별 성능 분포를 시각화해 특정 영역(코드, 수학, 에이전시 등)에서의 강점을 강조한다.
이 그래프는 MiniCPM5-1B가 코드 생성, 수학적 추론, 에이전시(도구 사용) 영역에서 비교 베이스라인보다 높은 점수를 보였음을 나타낸다. 레이더의 각 축은 General Knowledge, Domain Knowledge, Coding, Instruction Following, Math Reasoning, Logical Reasoning, Agentic 등으로 구성되어 있어 분야별 강약을 직관적으로 파악할 수 있다. 시각적 형상은 모델의 균형성과 특정 태스크에서의 우위를 함께 전달하며 README의 SOTA 주장과 정성적으로 일치한다.
비교표 이미지는 MiniCPM5-1B와 몇몇 동급 공개 모델의 상세 벤치마크 수치를 테이블 형태로 제공한다.
테이블은 MMLU, LCB, IFBench, AIME, MATH-500 등 다양한 벤치마크 항목별 점수를 제시해 모델의 영역별 성능을 정량적으로 보여준다. README 본문에서는 MiniCPM5-1B가 동일 크기 집단 내에서 SOTA 수준임을 주장하며, 특히 도구 사용과 코드·난해한 추론에서 우위를 나타냈다고 기술되어 있다. 이 표는 README의 정성적 판단을 뒷받침하는 수치 근거로 활용될 수 있다.
훈련 레시피 다이어그램은 base→mid→post 단계로 구성된 학습 흐름과 SFT→RL→OPD의 후처리 파이프라인을 도식화했다.
다이어그램은 안정적 학습과 decay 스킴을 포함한 base training 이후 mid-training을 거쳐 SFT와 RL, OPD로 이어지는 전체 파이프라인의 단계별 역할을 명확히 보여준다. 각 단계는 사용된 데이터(예: Ultra-FineWeb, UltraData-Math, UltraData-SFT)와 토큰 규모(예: 200B 토큰 수준의 SFT)를 연결해 어떤 데이터가 어떤 목표 역량을 강화했는지를 가시적으로 정리하고 있다. 이 구조는 README 텍스트의 단계적 학습 설계 주장과 직접적으로 대응한다.
두 단계 Reasoning RL 그래프는 응답 길이 제어와 AIME 2026 정확도 추이에서 두 단계 RL 스테이지의 영향을 시각화했다.
좌측 그래프는 응답 길이(clip ratio) 감소와 최대 응답 길이 설정 변화를 통해 overlong 응답률이 어떻게 줄어들었는지를 보여주며, 우측 그래프는 AIME 2026의 정확도(pass@1)에서 Reasoning RL 1→2로 진행하면서 정확도가 상승하는 경향을 나타낸다. 이 시각자료는 README의 수치 주장(평균 +16 포인트, 과다응답률 -29pp)과 연계되어 RL 스케줄과 OPD가 응답 제어와 정확도 개선에 실질적 영향을 미쳤음을 뒷받침한다. 두 그래프 모두 훈련 스텝에 따른 성능 변화를 시간축으로 제시해 학습 동역학을 이해하기 쉽도록 구성되었다.

977

LIKES

408.3k

DOWNLOADS

4 / 0

조회수

관련 토론

아직 관련 토론이 없습니다.

댓글

댓글을 작성하려면 로그인이 필요합니다.