1B 양자화 GGUF로 도구 호출과 128K 맥락을 지원하는 MiniCPM5 V2 빌드
MiniCPM5-1B의 Fable 5 V2 파인튜닝을 반영한 GGUF 양자화 빌드로서 도구 호출 강화와 Thinking 모드, 최대 128K 토큰 컨텍스트를 로컬 환경에서 제공한다.
TL;DR
이 모델은 openbmb MiniCPM5-1B를 기반으로 Fable 5 V2로 후학습한 결과물을 GGUF 포맷으로 양자화해 로컬 추론 환경에서의 즉시 사용성을 목표로 한다. Q8_0 양자화 파일을 권장 기본으로 제시해 약 1.1GB의 경량 배포를 가능하게 했고 F16 풀프리시전 파일을 병행 제공해 품질과 효율의 선택권을 남겼다. V2 단계에서는 특히 function-calling과 tool-calling 동작을 강화해 외부 API 연동과 플러그인 기반 자동화 워크플로에서 구조화된 호출 출력을 더 안정적으로 생성하도록 조정되었으며 README의 BFCL·API-Bank 수치가 파인튜닝 성능 향상을 뒷받침한다. 또한 Thinking 모드와 최대 128K 토큰 설정을 통해 복잡한 추론과 장문 컨텍스트 작업을 지원하지만 실제 사용 가능한 컨텍스트 길이는 런타임과 하드웨어 제약에 따라 달라진다.
핵심 역량
- 모델은 함수 호출(function-calling)과 외부 툴 연동을 강화한 출력을 생성하며, 출력에서 구조화된 함수 이름과 인자를 생성해 외부 API와 연동하는 워크플로를 지원한다. 이는 Fable 5 V2 파인튜닝을 통해 툴 호출 신뢰도를 높인 점을 바탕으로 하며, 실사용에서는 플러그인 또는 서버리스 엔드포인트와의 연동이 용이하다. 툴 호출 출력은 chat template 메타데이터를 통해 런타임에서 일관되게 재현되도록 내장되었다.
- 코드 생성과 디버깅 보조 기능을 제공하며, 샘플링 기본값과 Thinking 모드의 체계적 추론 흐름을 통해 복잡한 알고리즘 설명이나 코드 수정을 단계적으로 생성한다. 코드 관련 응답은 'Write a Python function to merge two sorted lists.' 같은 직접적인 과제를 처리하도록 최적화된 샘플링 파라미터를 권장한다. 코딩 워크플로에서는 로컬 실행과 빠른 반복 테스트가 가능하도록 GGUF 양자화로 경량 배포가 적용되었다.
- 지침 준수(instruction following) 능력이 개선되어 시스템/사용자 프롬프트 제약을 보다 충실히 반영하는 응답을 생성한다. Fable 5 데이터로의 후학습이 지침 일관성 향상에 기여했으며 복수의 샘플링 모드로 응답 스타일을 제어할 수 있다. 결과적으로 지시 기반 태스크에서 일관된 출력 형식을 기대할 수 있다.
- Thinking 모드를 통해 중간적 사고 블록(chain-of-thought)을 생성하며, 모델이 단계별 근거를 먼저 출력한 뒤 최종 결론을 제시하는 흐름을 지원한다. 이 모드는 복잡한 문제 해결이나 추론 근거가 필요한 응답에서 디버깅과 검증을 용이하게 한다. 다만 중간 사고 블록은 최종 답 이전에 노출될 수 있다는 README상의 제한을 포함한다.
- 장문 컨텍스트 처리를 지원하여 업스트림 config.json 기준으로 131,072 토큰을 설정 가능하며, 긴 대화 이력이나 대규모 문서 기반 작업에서 컨텍스트 유지가 개선된다. 실제 사용 가능한 길이는 런타임과 하드웨어 조건에 좌우되며 GGUF 런타임에서 메모리 설정을 조정해야 한다. 이 기능은 문서 요약, 장문의 질의응답, 코드베이스 전반에 대한 참조 생성 등에 유용하다.
강점
- 로컬 환경에서 실행 가능한 GGUF Q8_0 양자화 파일을 제공해 약 1.1GB 규모로 1B 모델을 경량 배포할 수 있으며, 이는 로컬 개발자와 오프라인 시나리오에서 빠른 반복을 가능하게 했다. 양자화 모델과 함께 F16 풀프리시전 파일을 병행 제공해 품질과 효율성 간 선택을 허용했다. 또한 chat template가 메타데이터에 내장되어 런타임별 추가 설정 없이 일관된 대화형 동작을 유지한다.
- 파인튜닝 결과로 툴 호출과 function-calling 동작이 강화되어 API 호출이나 플러그인 연동이 필요한 워크플로에서 더 안정적인 구조화된 출력을 생성하도록 설계되었다. README의 벤치마크는 BFCL 및 API-Bank에서 개선된 수치를 보고해 파인튜닝 효과를 정량적으로 뒷받침했다. 이러한 개선은 코드 생성과 자동화된 툴 연동 시 실용적 이점을 제공한다.
- 장문 컨텍스트(최대 128K 토큰)를 지원하도록 구성되어 긴 문서나 대화 히스토리를 유지하는 태스크에서 정보 손실을 줄이는 이점이 있다. 다만 실제 사용 가능한 컨텍스트 길이는 사용중인 GGUF 런타임과 하드웨어 제약에 따라 달라지며 README에 해당 한계가 명시되어 있다. 따라서 대규모 문서 작업에서는 런타임 메모리 설정과 하드웨어 계획이 필요하다.
훈련 방식
이 모델은 openbmb의 MiniCPM5-1B를 기반으로 Fable 5 데이터로 후학습(Fine-tune)한 결과물이며 V2 단계에서 특히 tool calling과 function-calling 동작을 강화하는 방향으로 파인튜닝이 적용되었다. 양자화는 변환 단계에서 수행되어 GGUF 형식으로 패키징되었고 Q8_0을 권장 기본값으로 제시해 로컬 경량 배포를 목표로 했다. 학습 세부와 옵티마이저 설정 등 더 구체적 트레이닝 파라미터는 체크포인트 측 메타데이터에 의존한다.
알아두면 좋은 것
- 이 리포지토리는 MiniCPM5-1B 기반의 Fable 5 V2 후학습판을 GGUF 포맷으로 제공하며 로컬 추론을 위해 llama.cpp, Ollama, LM Studio, jan, KoboldCpp 등 다양한 런타임과 호환된다. 제공 파일은 Q8_0 양자화와 F16 풀프리시전 두 가지로 구성되어 있으며 Q8_0이 권장 기본값으로 표기되어 있다. GGUF 메타데이터에는 MiniCPM5의 chat template가 내장되어 있어 런타임 로드 시 대화형 설정이 보존된다.
- V2 버전은 이전 V1 대비 툴 호출과 function-calling 동작을 강화했으며, README의 Capabilities 항목에서 해당 기능이 향상되었음이 명시되어 있다. 샘플링 추천값으로는 Think 모드(temperature=0.9, top_p=0.95)와 No Think 모드(temperature=0.7, top_p=0.95, enable_thinking=False)가 제시되어 있어 사용자가 사고 출력 여부와 창의성 수준을 제어할 수 있다. 모델 파일별 크기는 Q8_0 약 1.1GB, F16 약 2.1GB로 명확히 구분되어 있다.
- 벤치마크 표는 Transformers 체크포인트 기준 성능을 제공하며 BFCL, API-Bank, Tau-Bench 항목에서 V2의 상대적 향상이 보고되어 있다. BFCL non_live 43.06%·live 63.33%·API-Bank 22.10%와 같은 수치가 공개되어 있어 파인튜닝 효과를 정량적으로 확인할 수 있다. README는 또한 Thinking 출력의 특성과 1B 규모의 한계, 런타임 의존적 실제 컨텍스트 제한을 명시하여 사용상의 주의를 병기했다.
기술적 특징
- GGUF 양자화 패키징은 모델 가중치와 대화 템플릿 같은 메타데이터를 단일 파일로 결합해 다양한 로컬 런타임에서 즉시 로드가 가능하도록 설계되었다. 이 방식은 로컬 배포 시 추가 변환 과정을 제거하여 배포 복잡도를 낮췄으며, 파일별로 Q8_0와 F16을 병행 제공해 속도와 정확도의 선택권을 유지했다. 권장 양자화인 Q8_0은 1B 모델을 약 1.1GB로 축소해 개인 환경에서의 실행을 용이하게 했다.
- Fable 5 V2 후학습은 function-calling과 tool-calling 동작을 강화하는 방향으로 이루어졌으며, 이로 인해 모델은 출력에서 함수 이름과 구조화된 인자를 보다 안정적으로 생성하도록 조정되었다. 이러한 튜닝은 외부 API 연동과 자동화된 툴 체인에서 호출 형식을 정확히 맞추는 데 중점을 두었다. README에 수록된 BFCL·API-Bank 수치가 파인튜닝의 성능 향상을 뒷받침한다.
- Thinking 모드는 모델 내부에서 중간적 추론 블록을 생성하게끔 프롬프트와 샘플링 설정을 조정한 작동 모드이며, 기본 샘플링 파라미터(temperature, top_p)는 Think와 No Think 모드로 구분되어 있다. 이 구조는 복잡한 문제에서 단계별 근거를 생성하고 최종 결론을 도출하는 흐름을 재현하기 위해 채택되었다. 다만 README는 Thinking 출력이 최종 답 이전에 노출될 수 있는 한계를 명시해 검증이 필요한 응답 특성을 함께 고지했다.
- 장문 컨텍스트 지원은 upstream config.json 기준으로 131,072 토큰 설정을 가능하게 하여 긴 문서나 긴 대화 이력의 유지에 유리하도록 구성되었다. 이 기능은 모델의 컨텍스트 유지 능력을 개선하지만 실제 동작 가능 범위는 사용 중인 런타임과 시스템 메모리 제약에 따라 달라진다. 따라서 장문 작업 시에는 런타임의 메모리 설정과 -c 같은 토큰 버퍼 파라미터를 적절히 조정해야 한다.
차별점
- GGUF로 패키징된 Q8_0 양자화 파일을 권장 기본값으로 제공하여 개인 PC와 경량 서버에서 즉시 실행 가능한 배포 경험을 제공한다. 이 구성은 F16 풀프리시전 파일을 병행 제공해 품질-효율성 선택을 보장한다. 메타데이터에 chat template를 내장해 런타임 별 별도 템플릿 적용 없이 일관된 대화 동작을 유지한다.
- Fable 5 V2 파인튜닝으로 function-calling 및 tool-calling 동작이 명시적으로 강화되어 외부 함수 호출 형식의 출력 신뢰도가 향상되었다. 이 개선은 API 호출이나 플러그인과 결합된 자동화 워크플로에서 정확한 인자 생성률과 호출 안정성을 높이는 방향으로 적용되었다. README의 API-Bank 성능 향상 수치가 해당 차별점을 정량적으로 뒷받침한다.
- Thinking 모드를 기본 작동 모드로 제공하고 샘플링 프로파일(Think / No Think)을 명시해 사용자가 사고 출력의 존재와 창의성 수준을 명확히 제어할 수 있도록 했다. 이 설계는 추론 근거의 가시성과 디버깅 가능성을 확보하려는 요구에 대응한 선택이다. 동시에 Thinking 출력이 최종 응답 이전에 노출될 수 있다는 한계가 명시되어 투명성을 유지한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| BFCL non_live | percentage | 43.06% | vs MiniCPM5-1B (Base) 41.51% |
| BFCL live | percentage | 63.33% | vs MiniCPM5-1B (Base) 60.24% |
| API-Bank | percentage | 22.10% | vs MiniCPM5-1B (Base) 7.30% |
| Tau-Bench Airline | score | 0.36 (18/50) | vs MiniCPM5-1B (Base) 0.34 (17/50) |
| Tau-Bench Retail | score | 0.070 (8/115) | vs MiniCPM5-1B (Base) 0.052 (6/115) |
161
Likes
140.3k
Downloads
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.