3B 모델이 수학·코딩 경연에서 대형 모델에 근접한 성능을 보인 사례
text-generation — 수학적 추론·경쟁적 코딩 문제 해결·대화형 텍스트 생성mit
WeiboAI/VibeThinker-3B를 기반으로 파인튜닝된 3B 언어모델로, 수학적 추론과 경쟁적 코딩에서 고성능을 목표로 하며 GGUF·Q4 양자화로 경량 배포를 지원한다.
TL;DR
Mythos-nano는 WeiboAI의 VibeThinker-3B를 기반으로 파인튜닝된 3B 텍스트생성 모델로, 수학적 추론과 경쟁적 코딩(LeetCode 스타일) 성능을 중점으로 개발되었다. README의 벤치마크 표는 Mythos-nano가 여러 수학·코딩 벤치에서 높은 점수를 기록했음을 보여주며, 'Mythos-nano + CLR' 변형은 추가적인 성능 향상을 제시한다. 배포 측면에서는 f16 GGUF 빌드와 Q4_K_M 양자화 GGUF 파일을 제공해 로컬·저비용 환경에서의 실행을 지원하며, Transformers 예시에서는 bfloat16·CUDA 로딩을 권장하고 최대 40960 토큰 출력까지 허용한다고 명시되어 있다. 단점으로 거부 동작이 제거된 uncensored 빌드로 안전성 가드가 축소되어 있으며, 도구 호출·에이전트 프로그래밍 관련 데이터로 학습되지 않았다는 경고가 있어 해당 용도에는 적합하지 않다.
핵심 역량
- 단계적 수학적 추론과 경쟁 수학 문제(예: AIME, HMMT) 풀이
- 경쟁 프로그래밍/LeetCode 스타일 Python 문제 풀이와 코드 생성
- 대화형 텍스트 생성과 채팅 템플릿 응답
- 장문 출력 생성(README 권장 최대 출력 토큰 40960)과 샘플링 온도 조절(0.6–1.0)
- GGUF 및 Q4_K_M 포맷으로 로컬·경량 추론 환경에 배포 가능
강점
- 3B 모델임에도 공개된 수학·코딩 벤치마크에서 상위권 점수를 기록해 파라미터 효율성이 강조되었다(벤치마크 표 참조).
- MIT 라이선스와 GGUF/Q4 포맷 제공으로 상업적 이용·로컬 배포가 용이하다.
훈련 방식
WeiboAI/VibeThinker-3B를 기반으로 Fine-tuning을 수행하여 수학·코딩·추론 성능을 개선했으며, 구체적 학습 기법이나 사용된 데이터셋 세부 내용은 README에 명시되지 않았다.
알아두면 좋은 것
- 기반 모델은 WeiboAI/VibeThinker-3B이며 README에서 base_model_relation으로 'finetune'이 명시되어 있다.
- 모델은 도구 호출(tool-calling)·에이전트 프로그래밍 데이터로 학습되지 않아 함수 호출·API 오케스트레이션 작업에는 권장되지 않는다.
- 거부(refusal) 방향이 제거된 'uncensored' 빌드로 안전성 가드가 축소되어 있으며 사용자는 출력 책임을 부담해야 한다.
- GGUF 포맷의 f16 빌드와 Q4_K_M 양자화 빌드가 제공되어 llama.cpp/Ollama 등 경량 런타임에서 실행할 수 있다.
기술적 특징
- 기반 모델을 소형화하여 파인튜닝한 구조를 채택했다. README에 base_model: WeiboAI/VibeThinker-3B 및 base_model_relation: finetune가 명시되어 있어 사전학습된 3B 모델을 특정 태스크에 맞춰 미세조정한 방식이다. 이 접근은 모델 크기를 유지하면서 수학·코딩 성능을 끌어올리는 데 초점이 있다.
- 배포·추론 효율화를 위해 GGUF와 Q4_K_M 양자화 파일을 제공한다. README에 mythos-nano-f16.gguf 및 mythos-nano-Q4_K_M.gguf가 명시되어 있어 CPU 기반 llama.cpp/Ollama 환경 또는 저비용 추론에 적합한 경량 포맷을 지원한다.
- 추론 측면에서 bfloat16·CUDA 최적화를 권장한다. 사용 예시 코드에서 dtype=torch.bfloat16, device_map="cuda"를 사용하도록 권장해 GPU 기반 고속 생성에서 bfloat16 연산을 활용하도록 설계되었음이 드러난다.
- 벤치마크 표에는 'Mythos-nano + CLR' 변형이 따로 제시되어 성능 개선을 보이는 버전이 존재한다. README는 CLR 변형이 여러 벤치에서 점수를 향상시킨 결과를 표로 제시하지만 CLR의 기술적 정의나 구현 방식은 명시하지 않는다.
- 안전성·정책 측면에서 거부 동작이 제거된(uncensored) 빌드가 공개되어 있다. README 상단의 주석에서 거부 방향이 제거되었음을 분명히하며, 이로 인해 안전성 가드가 축소되었고 출력 책임이 사용자에게 있음을 명시한다.
차별점
- 소형(3B) 모델로 수학·코딩 벤치에서 대형 모델에 근접한 성능 표를 제시한 점
- GGUF와 Q4_K_M 양자화 빌드를 동시에 제공해 로컬 및 저자원 배포를 염두에 둔 배포 전략
- 거부 메커니즘을 비활성화한 uncensored 빌드를 공개해 제약 없는 출력이 가능하다는 점(동시에 안전 리스크 존재)
- README에서 'Mythos-nano + CLR' 버전으로 추가 성능 이득을 제시한 점(세부 구현은 미기재)
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| AIME25 | score | 91.4 | — |
| AIME26 | score | 94.3 | — |
| HMMT25 | score | 89.3 | — |
| BruMO25 | score | 93.8 | — |
| IMO-Ans | score | 76.4 | — |
| LCBv6 | score | 80.2 | — |
| OJBench | score | 38.6 | — |
| GPQA-D | score | 70.2 | — |
| IFEval | score | 93.4 | — |
| IFBench |
63
Likes
8k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.