TL;DR
StepFun-Prover-Preview는 Lean 4 REPL과의 자유로운 반복 상호작용을 학습 신호로 통합한 도구 통합 강화학습 파이프라인을 통해 정리 증명 성능을 개선하였다. 훈련은 공개 데이터 기반의 cold-start SFT, 잘못된 응답 교정으로 얻은 D1를 통한 추가 SFT, 그리고 GRPO를 사용한 tool-integrated RL과 그에 따른 반복적 RL-SFT 사이클로 구성되며, 롤아웃은 자연어 추론·Lean 4 코드·REPL 피드백을 순차적으로 포함하여 보상은 REPL 검증 통과 여부로 설정되었다. 실험에서 StepFun-Prover-Preview-32B는 miniF2F-test에서 pass@1 70.0%를 기록했으며, 최대 생성 길이와 REPL 상호작용 허용을 늘릴수록 성능이 꾸준히 향상되는 경향이 관찰되었다. 그러나 자동 정형화 산출물의 품질 문제와 긴 상호작용에 따른 계산 비용·시간제한은 향후 실무적 제약으로 남아 있다.
빠른 이해
새로운 점
REPL 피드백을 학습 신호로 직접 통합한 도구 통합 GRPO 파이프라인과 20K 컨텍스트 적용
핵심 메커니즘
모델이 자연어 추론을 생성하고 Lean 4 코드를 제출하면 REPL 출력(성공·오류)을 받아 이를 다음 생성에 반영하며, REPL 검증 통과 여부를 이진 보상으로 사용해 GRPO로 정책을 갱신함으로써 반복적 개선을 달성한다.
핵심 수치
- StepFun-Prover-Preview-32B pass@1 on miniF2F-test: 70.0%- 32 응답 샘플링, 20K 컨텍스트 윈도우 사용
- StepFun-Prover-Preview-7B pass@1 on miniF2F-test: 66.0%- 32 응답 샘플링
- DeepSeek-Prover-V2-7B pass@1 on miniF2F-test: 58.6%
- 성능 vs 최대 생성 길이 (32B): 4096→58.3%, 8192→66.5%, 12288→68.9%, 16384→69.9%, 20480→70.0%- 더 긴 최대 생성 길이가 pass@1 향상으로 이어짐
섹션별 상세
핵심 작동 원리와 보상 설계
- Tool-integrated rollout uses a hybrid trajectory combining natural language reasoning, Lean 4 code snippets, and REPL feedback, and assigns reward 1 when the REPL verification passes and 0 otherwise. — Methodology 섹션의 Tool-integrated Reinforcement Learning 설명
데이터 수집과 초기화된 학습 단계
실험 설정과 핵심 수치
- StepFun-Prover-Preview-32B achieves a pass@1 success rate of 70.0% on the miniF2F-test benchmark. — Results on MiniF2F Benchmark 및 Table 1
실전 예시와 한계 및 구현 관련 고려사항
AI 요약 · 북마크 · 개인 피드 설정 — 무료
출처 · 인용 안내
인용 시 "요약 출처: AI Trends (aitrends.kr)"를 표기하고, 사실 확인은 원문 보기 기준으로 진행해 주세요. 자세한 기준은 운영 정책을 참고해 주세요.