WeiboAI/VibeThinker-3B
VibeThinker-3B는 Qwen2.5-Coder-3B 기반의 3B 파라미터 모델로 SSP 기반 SFT+RL+자기증류 파이프라인과 CLR 테스트타임 스케일링으로 검증 가능한 추론 벤치에서 최상위권 성능을 달성했다.
학습 방식 · 모델은 Qwen/Qwen2.5-Coder-3B를 기반으로 한 후속 튜닝 모델이며 Spectrum-to-Signal Principle(SSP)을 중심으로 설계된 파이프라인을 사용했다. 파이프라인은 커리큘럼 기반의 두 단계 SFT로 넓은 해법 스펙트럼을 구축한 뒤 MaxEnt-Guided Policy Optimization을 포함한 RL로 올바른 해법 신호를 증폭하고, 이후 고품질 궤적을 오프라인 자기증류로 학생 모델에 재주입하는 방식으로 구성되었다. 마지막으로 규칙 기반 밸리데이터와 루브릭 보상 모델을 활용한 Instruct RL을 통해 사용자 지시 준수성과 출력 포맷 일관성을 개선했다.
TL;DR
VibeThinker-3B는 Qwen2.5-Coder-3B를 기반으로 한 3B 파라미터 규모의 모델로 Spectrum-to-Signal 원리에 따라 커리큘럼 SFT, MGPO 기반 RL, 오프라인 자기증류, Instruct RL을 순차적으로 적용해 검증 가능한 수학·코드 추론 성능을 끌어올린 모델이다. IMO-AnswerBench에서 기본 76.4점을 기록했고 Claim-Level Reliability Assessment 적용 시 80.6점으로 상승했으며 LeetCode 실전 평가에서 123/128 첫시도 통과(96.1%)를 보고해 경쟁형 코딩 문제에서도 높은 실용성을 보였다. 학습 파이프라인과 테스트타임 신뢰도 보정이 작은 모델의 성능을 대형 모델 수준의 범위로 확장시키는 핵심 메커니즘으로 작동했으며 다만 툴 호출이나 에이전트 오케스트레이션 용도로의 사용은 README에서 권장되지 않는다.
핵심 포인트
- 모델은 파라미터 규모가 작음에도 검증 가능한 추론 벤치에서 대형 모델과 유사한 성능 범위에 도달한 점이 차별화 요소이다. README에서 제시된 표와 그래프는 SSP 기반 파이프라인과 CLR 같은 테스트타임 보정이 작은 모델의 성능을 크게 끌어올렸음을 보였다. 이 접근은 단순한 파라미터 확장 대신 신호의 구조적 증폭을 통해 성능을 확보하는 전략이라는 점에서 특징적이다.
- 학습 파이프라인이 커리큘럼 SFT, MGPO 기반 RL, 오프라인 자기증류, Instruct RL을 연속적으로 결합한 점이 설계적 차별점이다. 각 단계는 역할이 분명하게 구분되어 있으며 특히 RL에서 얻은 고품질 궤적을 증류로 다시 주입하는 루프가 성능 안정성에 기여했다. 이러한 다단계 파이프라인 구성은 검증 가능한 추론 과제에서 작은 모델이 높은 신뢰도의 출력을 내도록 설계된 점에서 독특하다.
- Claim-Level Reliability Assessment(CLR)를 테스트타임 스케일링으로 채택해 각 주장 단위의 신뢰도를 평가하고 결과 선택에 반영한 점이 실용적 차별점이다. CLR 적용 시 특정 벤치에서 점수 향상이 보고되어 실제 배포 환경에서 신뢰도 기반 후처리를 통한 성능 개선 가능성을 보여주었다. 이 방법은 특히 정답 검증 신호가 존재하는 과제에서 효율적인 성능 보강 수단으로 작동한다.
- 작은 파라미터 규모(3B)에도 불구하고 검증 가능한 수학·코드 추론 벤치에서 상위권 성능을 보였다. README와 제공된 표에서 IMO-AnswerBench 76.4점, AIME/HMMT 등에서 고득점을 기록해 대형 모델의 성능 범위에 근접하는 결과가 보고되었다. 이러한 성과는 파라미터 규모보다 학습 신호의 구조화와 검증 가능한 보상 설계가 성능에 강한 영향을 미칠 수 있음을 시사한다.
벤치마크
| 벤치마크 | 지표 | 값 | 비교 |
|---|---|---|---|
| IMO-AnswerBench | score | 76.4 | CLR 적용 시 80.6; 비교 모델 예시로 DeepSeek V3.2 78.3, GLM-5 82.5, Kimi K2.5 81.8 |
| LeetCode contests acceptance | first-attempt acceptance rate | 96.1% | 123/128 첫시도 통과로 계산된 비율 |
| AIME25 | score | 91.4 | 정렬된 벤치 표에서 상위권 성능으로 보고 |
| HMMT25 | score | 89.3 | 대형 레퍼런스 모델의 점수 범위에 근접 |
이미지 분석




757
LIKES
72.7k
DOWNLOADS
9 / 0
조회수
관련 토론
아직 관련 토론이 없습니다.
댓글
댓글을 작성하려면 로그인이 필요합니다.