4B 모델로 120B급 성능 달성! 수학 올림피아드 증명에 특화된 초소형 추론 혁신
수학 정리 증명 및 논리적 추론 텍스트 생성4B49K 컨텍스트apache-2.0
Qwen3-4B를 기반으로 SFT와 RL을 거쳐 수학 올림피아드 수준의 엄밀한 증명을 생성하는 추론 특화 모델입니다.
핵심 역량
- 수학 올림피아드(IMO) 수준의 엄밀한 증명 생성
- 최대 49,152 토큰의 긴 추론 과정(Rollout) 지원
- 에이전트 스캐폴딩을 통한 추론 성능 확장 가능
- vLLM 및 SGLang API 배포 호환
- 4B 파라미터의 효율적인 로컬 실행 및 서빙
알아두면 좋은 것
- IMO-ProofBench 40% 달성 (기존 Qwen3 베이스 모델 대비 성능 20% 향상)
- GPT-OSS-120B 모델과 대등한 벤치마크 성능을 4B 크기에서 구현
- FineProofs-RL 데이터셋을 활용한 추론 캐시 기반 강화학습 적용
- 수학 증명 전용 모델로 일반적인 대화 태스크에는 부적합함 명시
76
Likes
1.2k
Downloads
0 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.